商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 英伟达开源TwoTower模型:保留98.7%质量,AI生成提速2.42倍

英伟达开源TwoTower模型:保留98.7%质量,AI生成提速2.42倍

  发布于2026-08-16 阅读(0)

扫一扫,手机访问

昨天,英伟达悄悄扔出一篇博文——他们发布了一款名为Nemotron-Labs-TwoTower的新模型,核心目标是解决大模型生成Token时那个绕不开的“速度墙”。简单来说,这是一款基于预训练自回归骨干网络的离散扩散语言模型,专为提速而生。


先说开源:模型权重已在Huggingface上以开源形式发布,授权协议用的是NVIDIA Nemotron Open Model License,开发者可以直接拿去用。

参数方面,总规模】60B,采用双塔架构——两个塔各占30B参数。具体拆开看,一个叫自回归塔(AR/context Tower),另一个叫扩散/降噪塔,每个塔都激活3B模型,并且在128个可路由专家之间调度。这个设计思路很有意思:传统的扩散语言模型把所有任务混在一起,TwoTower则把它们拆分到两个独立的神经网络“塔”里。

其中一个塔(上下文塔)是冻结的,专门负责维护文本的自回归上下文;另一个塔(去噪器塔)则负责训练,对噪声块进行去噪。两个塔通过逐层交叉注意力连接协作。这样的分离设计,说白了就是让专业的人干专业的事——一个塔专注记忆上下文,另一个塔专注“擦除噪声”,互不干扰。

性能数据最能说明问题。英伟达给出的综合基准测试结果显示,双塔架构保留了原模型98.7%的质量表现,但实际运行时的吞吐量提升了2.42倍。这意味着你几乎没丢掉多少精度,却换来了两倍多的生成速度,典型的“既要又要还能给”。下面是具体的测试对比结果:

任务Nemotron-3-Nano-30B-A3B (AR)Nemotron-Labs-TwoTower (diffusion)
MMLU (5-shot, acc)78.5678.24
MMLU-Pro (5-shot, CoT EM)62.5960.93
ARC-Challenge (25-shot, acc_norm)91.7292.66
WinoGrande (5-shot, acc)76.0976.09
RACE (0-shot, acc)88.9088.90
HumanEval (0-shot)79.2775.58
MBPP-Sanitized (3-shot)74.7174.28
GSM8K (8-shot, acc)92.4990.14
MATH-500 (4-shot)84.4080.60
MMLU Global Lite (5-shot)73.9773.94
MGSM (8-shot, a vg acc)80.8080.40
Quality retained100%98.7%
Generation throughput (× AR)1.0×2.42×

从表中可以看到,在数学推理(MATH-500、GSM8K)上有所下降,但在ARC-Challenge这种常识推理上反而还涨了一点。整体权衡下来,用不到2%的精度代价换2.42倍的速度提升,对于实际部署场景来说,这笔账怎么算都划算。当然,具体效果还得看落地时怎么调优,至少从架构思路和创新性上看,这个TwoTower值得关注。

本文转载于:https://www.163.com/dy/article/L0TRJTOO0511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注