发布于2026-08-20 阅读(0)
扫一扫,手机访问
英伟达这边又放了个大招。昨天(6月30日)官方博文透露,在自家Blackwell平台上,通过全栈推理优化,针对DeepSeek V4模型,其单Token成本直接降到了一个月前上线初期的五分之一——这个降幅,放在整个行业里都是相当炸裂的。

先简单解释一下什么叫单Token成本。你可以把它理解成模型每生成或处理一个基础语义单元(token)要花多少钱。这个指标直接决定了企业在部署大模型时的“燃料费”,所以英伟达已经明确把它列为了AI总拥有成本(TCO)的核心衡量标准。而这一次,Blackwell平台给出的答案是:针对DeepSeek V4,我们已经做到了行业最低。
这么大的成本下降,靠的不是某单一技术,而是一整套体系化的优化思路。英伟达在博文中把工作拆成了三个层次:

真正让人眼前一亮的是性能层面的突破。英伟达搞了一套组合拳:分离式服务、大规模专家并行、基于NVIDIA NVLink的并行通信、NVFP4精度,再加上多token预测等等。把这些技术叠加优化之后,Blackwell平台上单GPU的token吞吐量最高提升了20倍。注意,这不是实验室数据,是跑DeepSeek V4的实际效果——20倍的吞吐量提升,意味着单位时间内能处理的请求暴增,单Token成本自然就压下来了。


几个关键细节值得反复琢磨:专家并行和NVLink的结合,让大规模模型拆成多个专家后还能高效通信,避免了“跨卡通信卡脖子”的老问题;NVFP4精度则是在几乎不影响模型效果的前提下,大幅降低了显存和带宽占用——这两项加在一起,才是能把成本砍到五分之一的真正杀手锏。
从行业角度看,英伟达这次的动作其实是在传递一个信号:大模型推理的成本天花板正在被系统性击穿。对于企业用户来说,这意味着部署DeepSeek V4这样的大模型不再只是“烧钱实验”,而是开始具备实实在在的商业可行性。当然,Blackwell平台的门槛不低,但单Token成本降到五分之一这个数字,足以让很多观望中的企业重新算一笔账了。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9