当前位置:

首页 > 业界资讯 > Meta用《圣经》训练超多语言模型:识别1107种、辨认4017种语言

Meta用《圣经》训练超多语言模型:识别1107种、辨认4017种语言

在《圣经》中有一个巴别塔的故事,说是人类联合起来计划兴建一座高塔,希望能通往天堂,但神扰乱了人类的语言,计划也就因此失败。到了今天,AI技术有望拆除人类语言之间的藩篱,帮助人类造出文明的巴别塔。近日,Meta的一项研究向这个方面迈出了重要一步,他们将新提出的方法称为MassivelyMultilingualSpeech(超多语言语音/MMS),其以《圣经》作为训练数据的一部分,得到了以下成果:在1107种语言上用wave2vec2.0训练得到了一个有10亿参数的多语言语音识别模型,相比于OpenAI的Wh

在《圣经》中有一个巴别塔的故事,说是人类联合起来计划兴建一座高塔,希望能通往天堂,但神扰乱了人类的语言,计划也就因此失败。到了今天,AI 技术有望拆除人类语言之间的藩篱,帮助人类造出文明的巴别塔。

近日,Meta 的一项研究向这个方面迈出了重要一步,他们将新提出的方法称为 Massively Multilingual Speech(超多语言语音 / MMS),其以《圣经》作为训练数据的一部分,得到了以下成果:

  • 在 1107 种语言上用 wave2vec 2.0 训练得到了一个有 10 亿参数的多语言语音识别模型,相比于 OpenAI 的 Whisper 模型,其错误率降低了 50% 以上。 
  • 单个音频合成模型就支持这 1107 种语言的文本转语音(TTS)。 
  • 开发了一个能够辨别 4017 种语言的语言辨识分类器。 

对于很多罕见语言的数据稀少问题,Meta 是如何解决的呢?他们采用的方法很有意思,即采用宗教的语料库,因为像是《圣经》这样的语料具有最「对齐的」语音数据。尽管这个数据集偏向宗教内容并且主要是男性声音,但其论文表明这个模型在其它领域以及使用女声时也表现优良。这是基础模型的涌现行为,着实让人惊叹。而更让人惊叹的是,Meta 将新开发的模型(语音识别、TTS 和语言辨识)都免费发布出来了!

  • 模型下载:https://github.com/facebookresearch/fairseq/tree/main/examples/mms
  • 论文地址:https://research.facebook.com/publications/scaling-speech-technology-to-1000-languages/

新提出的方法

为了打造出一个能识别千言万语的语音模型,首要的挑战是收集各种语言的音频数据,因为现目前已有的最大语音数据集也只有至多 100 种语言。为了克服这个问题,Meta 的研究者使用了宗教文本,比如《圣经》,这些文本已被翻译成了许多不同语言,并且那些译本都已被广泛研究过。这些译本都有人们用不同语言阅读的录音,并且这些音频也是公开可用的。使用这些音频,研究者创建了一个数据集,其中包含人们用 1100 种语言阅读《新约》的音频,其中每种语言的平均音频长度为 32 小时。

然后他们又纳入了基督教的其它许多读物的无标注录音,从而将可用语言数量增加到了 4000 以上。尽管这个数据集领域单一,并且大都是男声,但分析结果表明 Meta 新开发的模型在女声上表现也同样优良,并且该模型也不会格外偏向于产生更宗教式的语言。研究者在博客中表示,这主要是得益于他们使用的 Connectionist Temporal Classification(连接主义时间分类)方法,相比于大型语言模型(LLM)或序列到序列语音识别模型,这种方法要远远更为受限。

Meta用《圣经》训练超多语言模型:识别1107种、辨认4017种语言

潜在的性别偏见情况分析。在 FLEURS 基准上,这个在超多语言语音(MMS)数据集上训练的自动语音识别模型在男声和女声上的错误率是差不多的。

为了提升数据质量,使之能被机器学习算法使用,他们还采用了一些预处理方法。首先,他们在现有的 100 多种语言的数据上训练了一个对齐模型,然后再搭配使用了一个高效的强制对齐算法,该算法可处理 20 分钟以上的超长录音。之后,经过多轮对齐过程,最终再执行一步交叉验证过滤,基于模型准确度移除可能未对齐的数据。为了方便其他研究者创建新的语音数据集,Meta 将该对齐算法添加到了 PyTorch 并放出了该对齐模型。

要训练出普遍可用的监督式语音识别模型,每种语言仅有 32 小时的数据可不够。因此,他们的模型是基于 wav2vec 2.0 开发的,这是他们之前在自监督语音表征学习上的研究成果,能极大减少训练所需的有标注数据量。具体来说,研究者使用 1400 多种语言的大约 50 万小时语音数据训练了一个自监督模型 —— 这个语言数量已经超过之前任何研究的五倍以上了。然后,基于具体的语音任务(比如多语言语音识别或语言辨识),研究者再对所得模型进行微调。

结果

研究者在一些已有基准上评估了新开发的模型。

其多语言语音识别模型的训练使用了含 10 亿参数的 wav2vec 2.0 模型,训练数据集包含 1100 多种语言。随着语言数量增加,模型性能确实会下降,但下降幅度非常小:当语言数量从 61 种增加到 1107 种时,字符错误率仅上升了 0.4%,但语言覆盖范围却增加了 18 倍以上。

Meta用《圣经》训练超多语言模型:识别1107种、辨认4017种语言

在 61 种 FLEURS 语言的基准测试上,随语言数量增长的字符错误率变化情况,错误率越高,模型越差。

通过对比 OpenAI 的 Whisper 模型,研究者发现他们的模型的词错误率仅有 Whisper 的一半,而同时新模型支持的语言数量还多 11 倍。这个结果足以表明新方法的卓越能力。

Meta用《圣经》训练超多语言模型:识别1107种、辨认4017种语言

在可直接比较的 54 种 FLEURS 语言的基准测试上,OpenAI Whisper 与 MMS 的词错误率对比。

接下来,使用之前已有的数据集(如 FLEURS 和 CommonVoice)和新数据集,Meta 的研究者还训练了一个语言辨识(LID)模型,并在 FLEURS LID 任务上进行了评估。结果表明,新模型不仅表现很棒,而且支持的语言数量也增加了 40 倍。

之前的研究在 VoxLingua-107 基准上也仅支持 100 多种语言,而 MMS 支持超过 4000 种语言。

另外 Meta 还构建了一个支持 1100 种语言的文本转语音系统。当前文本转语音模型的训练数据通常是来自单个说话人的语音语料。MMS 数据的一个局限性是许多语言都只有少量说话人,甚至往往只有一个说话人。但是,在构建文本转语音系统时,这却成了一个优势,于是 Meta 就顺便造了一个支持 1100 多种语言的 TTS 系统。研究者表示,这些系统生成的语音质量其实相当好,下面给出了几个例子。

约鲁巴语、伊洛科语和迈蒂利语的 MMS 文本转语音模型演示。

尽管如此,研究者表示 AI 技术都仍不完美,MMS 也是如此。举个例子,MMS 在语音转文本时可能错误转录选定的词或短语。这可能导致输出结果中出现冒犯性和 / 或不准确的语言。研究者强调了与 AI 社区合作共同进行负责任开发的重要性。

用单个模型支持千言万语的价值

世界上有许多语言濒临灭绝,而当前的语音识别和语音生成技术的局限性只会进一步加速这一趋势。研究者在博客中设想:也许技术能鼓励人们留存自己的语言,因为有了好的技术后,他们完全可以使用自己喜欢的语言来获取信息和使用技术。

他们相信 MMS 项目是朝这个方向迈出的重要一步。他们还表示这个项目还将继续开发,未来还将支持更多语言,甚至还会解决方言和口音的难题。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯 模型
相关文章 更多
腾讯智能体开源升级,关键科技全面开放
腾讯智能体开源升级,关键科技全面开放

不谈智能体,客户都不见你。腾讯云副总裁、腾讯云智能负责人、腾讯优图实验室负责人吴运声在采访中坦言。这意味着,如今提供云服务,若没有智能体相关的硬核能力,已难以打动客户。在2025腾讯全球数字生态大会上,腾讯云给出了自己的回应:正式发布智能体开发平台3.0(ADP3.0),并宣布腾讯优图实验室的关键智能体技术将逐步开源。据悉,该版本历经近三个月集中迭代,累计上线近600项功能,在RAG能力、Workflow流程、多智能体协作、应用评测及插件生态等方面实现全面升级。更值得关注的是,腾讯云透露未来数月将持续开源

特斯拉FSD新增滑板识别模型
特斯拉FSD新增滑板识别模型

近日,有汽车领域博主爆料,特斯拉的FSD(完全自动驾驶)辅助系统将迎来一次重要升级,或将实现更真实的环境场景还原。在最新曝光的软件代码中,发现了大量新增的渲染模型,涵盖多种车辆与行人类型。这些新增模型包括救护车、消防车、垃圾清运车、校车、半挂式卡车、高尔夫球车、骑电动滑板车的行人、使用轮椅的行人、玩滑板的行人、推婴儿车的行人,以及道路清扫车、三轮车、拖车、火车和有轨电车等。这一系列高精度建模意味着FSD系统将能更准确识别并响应复杂交通参与者的行为。据CNMO掌握的消息,日本方面已为特斯拉FSD系统的落地扫

阿里开源14B电影级视频模型,实测可玩
阿里开源14B电影级视频模型,实测可玩

AI视频生成正迎来属于“通义”的高光时刻!就在昨晚,阿里巴巴悄然推出了一款由音频驱动的14B视频大模型——Wan2.2-S2V。只需上传一张静态图片和一段音频,就能生成出面部表情生动、口型精准匹配、肢体动作流畅自然的电影级数字人视频,效果惊艳。实际效果展示如下:△来自@AIMIRAI46487更令人振奋的是,这款新模型一经发布便全面开源,现在所有人都可以免费在通义万相官网体验使用。据官方介绍,Wan2.2-S2V的核心优势包括:支持最长分钟级的单次视频生成,画面稳定且具有一致性;具备影院级别的音

Tachyum发布TDIMM内存技术 单条带宽281GB/s
Tachyum发布TDIMM内存技术 单条带宽281GB/s

11月26日,据相关报道,Tachyum正式推出其全新研发的TDIMM内存技术,旨在为人工智能与高性能计算领域带来更高带宽、更大容量及更低功耗的先进解决方案。该技术基于Tachyum旗下的ProdigyUltimate处理器平台构建,单条TDIMM模块可实现高达281GB/s的带宽,相较当前主流的DDR5内存提升了约5.5倍。ProdigyUltimate处理器支持多达24个内存通道,使系统总带宽达到惊人的6.7TB/s,约为传统12通道CPU系统的11倍水平。在存储容量方面,标准版TDIMM提供

华为盘古 Ultra MoE 模型发布
华为盘古 Ultra MoE 模型发布

5月30日,华为推出了全新的AI模型——盘古UltraMoE,该模型的参数量达到了7180亿。作为一款接近万亿参数的MoE(MixtureofExperts)模型,它在整个训练过程中完全基于华为的昇腾AI平台完成,标志着华为在超大规模模型训练方面取得了重要进展。盘古UltraMoE的成功训练离不开盘古团队研发的一系列创新技术。例如,Depth-ScaledSandwich-Norm(DSSN)稳定架构的引入,显著改善了超大规模模型训练期间出现的梯度异常及

惠普G5喷墨技术发布,引领家用打印新体验
惠普G5喷墨技术发布,引领家用打印新体验

9月23日,2025惠普创新喷墨打印技术媒体分享会在北京圆满举行。惠普正式发布全新一代G5喷墨打印技术,并推出多款面向家庭学习、办公应用及照片打印的全新产品,致力于为中国用户打造更智能、更稳定的打印体验。据悉,G5技术采用先进的墨滴精准控制技术和优化升级的黑色墨水配方,显著提升输出品质,使文字边缘更锐利、图像色彩更逼真。同时具备防荧光笔渗透、防水防褪色等实用性能。其打印头寿命长达2000小时不堵塞,相比上一代延长50%,大幅降低维护频率与使用成本,切实解决家庭用户的日常困扰。此次惠普还

SOTA大模型加密数据评测:Qwen3仅破10%
SOTA大模型加密数据评测:Qwen3仅破10%

大语言模型面对加密数据,即便最新的Qwen3也会感到压力!尽管当下各类推理模型在多种基准测试中表现优异,但在密码学这样对逻辑严谨性和细节准确性要求极高的专业领域,模型的推理能力还有待深入挖掘。密码学不仅要求模型具备高级数学运算能力和严密的逻辑推理链,还需要其能够精准辨识复杂加密模式中的潜在规律;成功解密要求模型拥有极强的综合推理能力。上海AILab等联合推出的CipherBank测评,使用大量真实隐私场景数据和多种密码算法,严苛挑战当前最先进的大模型。CipherBank的测评结果显示,目前的大语言模型

通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API
通义千问新技能!用“扮演”方式提升推理能力,不再依赖搜索API

强化学习(RL)结合真实搜索引擎可以显著提升大模型的检索和推理能力。然而,这一方法面临两大挑战:搜索引擎返回的文档质量不稳定,导致训练过程中的噪音和不稳定性;RL训练需要频繁部署,产生大量API开销,限制了可扩展性。针对这些问题,阿里通义实验室推出了开源解决方案ZeroSearch,这是一个无需与真实搜索引擎交互的强化学习框架。实验表明,ZeroSearch只需使用3B参数的LLM作为检索模块,就能有效提升搜索能力,并大幅节省API成本。ZeroSearch让LLM实现自给自足

Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬
Siri等明年!苹果WWDC25给AI交底:画小饼,继续熬

不求速胜,熬吧。

第二代Ameca亮相!对答如流,表情逼真,多语种交流
第二代Ameca亮相!对答如流,表情逼真,多语种交流

编辑:桃子【新智元导读】第二代Ameca升级亮相,搭载GPT-4技术,实现实时对话。人形机器人Ameca迎来了它的第二代版本!近期,在2024年世界移动通信大会(MWC)上,全球最先进的机器人Ameca再度亮相。Ameca在会场周围吸引了大量观众。通过GPT-4的增强,Ameca能够即时回应各种问题。「展示一段舞蹈吧」。当被问及是否有情感时,Ameca通过一系列逼真的面部表情作出回应。就在几天前,开发Ameca的英国机器人公司EngineeredArts展示了他们团队的最新成果。视频中,Ameca具备了

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。