英伟达这边又放了个大招。昨天(6月30日)官方博文透露,在自家Blackwell平台上,通过全栈推理优化,针对DeepSeek V4模型,其单Token成本直接降到了一个月前上线初期的五分之一——这个降幅,放在整个行业里都是相当炸裂的。

先简单解释一下什么叫单Token成本。你可以把它理解成模型每生成或处理一个基础语义单元(token)要花多少钱。这个指标直接决定了企业在部署大模型时的“燃料费”,所以英伟达已经明确把它列为了AI总拥有成本(TCO)的核心衡量标准。而这一次,Blackwell平台给出的答案是:针对DeepSeek V4,我们已经做到了行业最低。
这么大的成本下降,靠的不是某单一技术,而是一整套体系化的优化思路。英伟达在博文中把工作拆成了三个层次:
- 生产运营层——主要管分布式服务、编排、自动扩缩容和内存管理,相当于AI推理的“调度大脑”;
- 应用加速层——专注于运行时优化,比如计算与通信的重叠、内核融合,让每个算子都跑得更高效;
- 基础设施访问层——直接调用GPU、网络、内存与系统能力,把硬件潜力彻底榨干。

真正让人眼前一亮的是性能层面的突破。英伟达搞了一套组合拳:分离式服务、大规模专家并行、基于NVIDIA NVLink的并行通信、NVFP4精度,再加上多token预测等等。把这些技术叠加优化之后,Blackwell平台上单GPU的token吞吐量最高提升了20倍。注意,这不是实验室数据,是跑DeepSeek V4的实际效果——20倍的吞吐量提升,意味着单位时间内能处理的请求暴增,单Token成本自然就压下来了。


几个关键细节值得反复琢磨:专家并行和NVLink的结合,让大规模模型拆成多个专家后还能高效通信,避免了“跨卡通信卡脖子”的老问题;NVFP4精度则是在几乎不影响模型效果的前提下,大幅降低了显存和带宽占用——这两项加在一起,才是能把成本砍到五分之一的真正杀手锏。
从行业角度看,英伟达这次的动作其实是在传递一个信号:大模型推理的成本天花板正在被系统性击穿。对于企业用户来说,这意味着部署DeepSeek V4这样的大模型不再只是“烧钱实验”,而是开始具备实实在在的商业可行性。当然,Blackwell平台的门槛不低,但单Token成本降到五分之一这个数字,足以让很多观望中的企业重新算一笔账了。