英伟达刷新DeepSeek V4推理纪录:单Token成本降至1/5
一款功能强大的目前最新版本视频处理软件,内置丰富的视频转场特效供用户选择使用,支持多种主流音视频编码的转换功能。
英伟达在Blackwell针对DeepSeekV4全栈推理优化,单Token成本降至上月五分之一。采用分离服务、专家并行、NVLink及NVFP4,单卡吞吐量提升20倍,实现最低推理成本。
英伟达这边又放了个大招。昨天(6月30日)官方博文透露,在自家Blackwell平台上,通过全栈推理优化,针对DeepSeek V4模型,其单Token成本直接降到了一个月前上线初期的五分之一——这个降幅,放在整个行业里都是相当炸裂的。

先简单解释一下什么叫单Token成本。你可以把它理解成模型每生成或处理一个基础语义单元(token)要花多少钱。这个指标直接决定了企业在部署大模型时的“燃料费”,所以英伟达已经明确把它列为了AI总拥有成本(TCO)的核心衡量标准。而这一次,Blackwell平台给出的答案是:针对DeepSeek V4,我们已经做到了行业最低。
这么大的成本下降,靠的不是某单一技术,而是一整套体系化的优化思路。英伟达在博文中把工作拆成了三个层次:
- 生产运营层——主要管分布式服务、编排、自动扩缩容和内存管理,相当于AI推理的“调度大脑”;
- 应用加速层——专注于运行时优化,比如计算与通信的重叠、内核融合,让每个算子都跑得更高效;
- 基础设施访问层——直接调用GPU、网络、内存与系统能力,把硬件潜力彻底榨干。

真正让人眼前一亮的是性能层面的突破。英伟达搞了一套组合拳:分离式服务、大规模专家并行、基于NVIDIA NVLink的并行通信、NVFP4精度,再加上多token预测等等。把这些技术叠加优化之后,Blackwell平台上单GPU的token吞吐量最高提升了20倍。注意,这不是实验室数据,是跑DeepSeek V4的实际效果——20倍的吞吐量提升,意味着单位时间内能处理的请求暴增,单Token成本自然就压下来了。


几个关键细节值得反复琢磨:专家并行和NVLink的结合,让大规模模型拆成多个专家后还能高效通信,避免了“跨卡通信卡脖子”的老问题;NVFP4精度则是在几乎不影响模型效果的前提下,大幅降低了显存和带宽占用——这两项加在一起,才是能把成本砍到五分之一的真正杀手锏。
从行业角度看,英伟达这次的动作其实是在传递一个信号:大模型推理的成本天花板正在被系统性击穿。对于企业用户来说,这意味着部署DeepSeek V4这样的大模型不再只是“烧钱实验”,而是开始具备实实在在的商业可行性。当然,Blackwell平台的门槛不低,但单Token成本降到五分之一这个数字,足以让很多观望中的企业重新算一笔账了。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。
Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。
Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。















