商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 英伟达发布Audex音频-文本统一模型:30B总参数

英伟达发布Audex音频-文本统一模型:30B总参数

  发布于2026-08-16 阅读(0)

扫一扫,手机访问

英伟达在今年 6 月发表了一篇论文,正式推出了一款名为 Audex(Nemotron-Labs-Audex-30B-A3B)的统一音频-文本大语言模型。总参数量 30B,激活参数仅 3B——也就是说,它保留了核心文本智能,同时还能理解和生成音频与语音。在目前多模态大模型动不动就往百亿参数狂奔的背景下,这种“大而省”的设计思路本身就很有意思。

模型的骨干是英伟达自研的文本模型 Nemotron-Cascade-2-30B-A3B,52 层混合 Mamba-Transformer 结构,内嵌 128 个可路由专家,每次推理只激活其中 6 个专家。说白了,这就是一套“专家库”策略:需要什么能力就调什么专家,既不浪费算力,又能兼顾复杂任务。

设计上,Audex 最核心的诉求是:多模态扩展不能把文本能力搞崩了。很多模型一加音频、视觉,文本能力就跳水,英伟达这次显然想打个翻身仗。他们把音频输入编码后直接映射到文本嵌入空间,同时把量化后的音频输出 token 和文本 token 放在一起统一处理——架构上很干净。

音频组件这边,Audex 用了 AF-Whisper 做音频编码器,处理 16kHz 输入,后面跟着两层 MLP 适配器做特征映射。输出词表从原始的 131072 个 token 扩展到了 205312 个 token,多出来的部分主要留给音频专用表示。语音输出则靠 X-Codec2 编解码器,速率每秒 50 个 token,单层有限标量量化(finite scalar quantization),码本大小 65536。非语音音频部分用了另一套工具 X-Codec,速率变成每秒 200 个 token,4 层展平残差向量量化。

最后聊聊评测成绩。文本方面,Audex 在 MMLU-Redux 上拿到了 86.4,比骨干模型的 86.3 略高;在 IMO AnswerBench 上拿了 81.1,明显超过骨干的 79.3。但在 MMLU-Pro 和 GPQA-Diamond 上出现了小幅下降。整体来看,文本能力不仅没有因为加入音频而拖后腿,反倒在一些基准上还有增益,这对于多模态模型来说已经算是很亮眼的成绩了。

本文转载于:https://www.163.com/dy/article/L1APKCF40511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注