发布于2026-08-16 阅读(0)
扫一扫,手机访问
昨天,英伟达悄悄扔出一篇博文——他们发布了一款名为Nemotron-Labs-TwoTower的新模型,核心目标是解决大模型生成Token时那个绕不开的“速度墙”。简单来说,这是一款基于预训练自回归骨干网络的离散扩散语言模型,专为提速而生。

先说开源:模型权重已在Huggingface上以开源形式发布,授权协议用的是NVIDIA Nemotron Open Model License,开发者可以直接拿去用。
参数方面,总规模】60B,采用双塔架构——两个塔各占30B参数。具体拆开看,一个叫自回归塔(AR/context Tower),另一个叫扩散/降噪塔,每个塔都激活3B模型,并且在128个可路由专家之间调度。这个设计思路很有意思:传统的扩散语言模型把所有任务混在一起,TwoTower则把它们拆分到两个独立的神经网络“塔”里。
其中一个塔(上下文塔)是冻结的,专门负责维护文本的自回归上下文;另一个塔(去噪器塔)则负责训练,对噪声块进行去噪。两个塔通过逐层交叉注意力连接协作。这样的分离设计,说白了就是让专业的人干专业的事——一个塔专注记忆上下文,另一个塔专注“擦除噪声”,互不干扰。
性能数据最能说明问题。英伟达给出的综合基准测试结果显示,双塔架构保留了原模型98.7%的质量表现,但实际运行时的吞吐量提升了2.42倍。这意味着你几乎没丢掉多少精度,却换来了两倍多的生成速度,典型的“既要又要还能给”。下面是具体的测试对比结果:
| 任务 | Nemotron-3-Nano-30B-A3B (AR) | Nemotron-Labs-TwoTower (diffusion) |
|---|---|---|
| MMLU (5-shot, acc) | 78.56 | 78.24 |
| MMLU-Pro (5-shot, CoT EM) | 62.59 | 60.93 |
| ARC-Challenge (25-shot, acc_norm) | 91.72 | 92.66 |
| WinoGrande (5-shot, acc) | 76.09 | 76.09 |
| RACE (0-shot, acc) | 88.90 | 88.90 |
| HumanEval (0-shot) | 79.27 | 75.58 |
| MBPP-Sanitized (3-shot) | 74.71 | 74.28 |
| GSM8K (8-shot, acc) | 92.49 | 90.14 |
| MATH-500 (4-shot) | 84.40 | 80.60 |
| MMLU Global Lite (5-shot) | 73.97 | 73.94 |
| MGSM (8-shot, a vg acc) | 80.80 | 80.40 |
| Quality retained | 100% | 98.7% |
| Generation throughput (× AR) | 1.0× | 2.42× |
从表中可以看到,在数学推理(MATH-500、GSM8K)上有所下降,但在ARC-Challenge这种常识推理上反而还涨了一点。整体权衡下来,用不到2%的精度代价换2.42倍的速度提升,对于实际部署场景来说,这笔账怎么算都划算。当然,具体效果还得看落地时怎么调优,至少从架构思路和创新性上看,这个TwoTower值得关注。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9