商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 英伟达刷新DeepSeek V4推理纪录:单Token成本降至1/5

英伟达刷新DeepSeek V4推理纪录:单Token成本降至1/5

  发布于2026-08-20 阅读(0)

扫一扫,手机访问

英伟达这边又放了个大招。昨天(6月30日)官方博文透露,在自家Blackwell平台上,通过全栈推理优化,针对DeepSeek V4模型,其单Token成本直接降到了一个月前上线初期的五分之一——这个降幅,放在整个行业里都是相当炸裂的。


先简单解释一下什么叫单Token成本。你可以把它理解成模型每生成或处理一个基础语义单元(token)要花多少钱。这个指标直接决定了企业在部署大模型时的“燃料费”,所以英伟达已经明确把它列为了AI总拥有成本(TCO)的核心衡量标准。而这一次,Blackwell平台给出的答案是:针对DeepSeek V4,我们已经做到了行业最低。

这么大的成本下降,靠的不是某单一技术,而是一整套体系化的优化思路。英伟达在博文中把工作拆成了三个层次:

  • 生产运营层——主要管分布式服务、编排、自动扩缩容和内存管理,相当于AI推理的“调度大脑”;
  • 应用加速层——专注于运行时优化,比如计算与通信的重叠、内核融合,让每个算子都跑得更高效;
  • 基础设施访问层——直接调用GPU、网络、内存与系统能力,把硬件潜力彻底榨干。


真正让人眼前一亮的是性能层面的突破。英伟达搞了一套组合拳:分离式服务、大规模专家并行、基于NVIDIA NVLink的并行通信、NVFP4精度,再加上多token预测等等。把这些技术叠加优化之后,Blackwell平台上单GPU的token吞吐量最高提升了20倍。注意,这不是实验室数据,是跑DeepSeek V4的实际效果——20倍的吞吐量提升,意味着单位时间内能处理的请求暴增,单Token成本自然就压下来了。



几个关键细节值得反复琢磨:专家并行和NVLink的结合,让大规模模型拆成多个专家后还能高效通信,避免了“跨卡通信卡脖子”的老问题;NVFP4精度则是在几乎不影响模型效果的前提下,大幅降低了显存和带宽占用——这两项加在一起,才是能把成本砍到五分之一的真正杀手锏。

从行业角度看,英伟达这次的动作其实是在传递一个信号:大模型推理的成本天花板正在被系统性击穿。对于企业用户来说,这意味着部署DeepSeek V4这样的大模型不再只是“烧钱实验”,而是开始具备实实在在的商业可行性。当然,Blackwell平台的门槛不低,但单Token成本降到五分之一这个数字,足以让很多观望中的企业重新算一笔账了。

本文转载于:https://www.163.com/dy/article/L0OO4HRI0511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注