您的位置:首页 >NVIDIA公开Rubin GPU架构细节:面向Agentic AI重新设计GPU
发布于2026-07-30 阅读(0)
扫一扫,手机访问
NVIDIA 官方技术博客这两天放出了重磅消息,首次系统性地揭开了下一代 Rubin GPU 架构的面纱。和之前 CES、GTC 上公布的产品规格不同,这次的重点不再是 FP4 算力、HBM4 这些基础参数,而是 Rubin 如何围绕 Agentic AI(智能体 AI)重新设计——说白了,就是为接下来更复杂的推理、规划、多 Agent 协作场景量身打造。

背后的逻辑其实很清晰:生成式 AI 时代靠的是大规模训练,但未来 AI 计算的重心会逐渐转向推理、规划、多 Agent 协作和工具调用。这类工作负载有三个特点——上下文更长、数据交换更频繁、CPU 与 GPU 协同需求更高。所以 GPU 架构的优化目标,也必须从单纯堆峰值算力,转向提升整体系统吞吐率、能效和每 Token 成本。

Rubin GPU 为此在多个关键模块做了重新设计。其中,Tensor Memory Accelerator(TMA)获得了进一步增强,专门用来降低专家模型(MoE)等复杂负载中的数据搬运开销。通过更灵活的描述符管理,减少 GPU 等待数据的时间,让计算单元保持更高利用率。NVIDIA 表示,这其实是在解决一个现实问题:大模型推理的计算速度越来越快,但数据供给反而成了瓶颈。
另一项重要升级来自第三代 Transformer Engine。这次加入了 Adaptive Compression(自适应压缩)能力,可以对 KV Cache 等推理数据做动态压缩。在尽量保持模型精度的前提下,显著降低 HBM 带宽占用,从而缓解长上下文推理带来的内存压力。换句话说,Rubin 不仅靠 HBM4 更高的物理带宽提升性能,更通过软硬件协同来提升显存利用效率。

从产品规格看,Rubin 平台延续了此前公布的信息:单颗 GPU 最高 50 PFLOPS(NVFP4)AI 算力,HBM4 高带宽显存,与 Vera CPU 组成新一代 Vera Rubin 平台。整机层面,Vera Rubin NVL72 由 72 块 Rubin GPU 和 36 颗 Vera CPU 组成,针对大规模 AI 推理和后训练(Post-training)做了专门优化。

值得关注的是,NVIDIA 这次还首次披露了更多产业合作伙伴的部署情况。CoreWea ve、Google Cloud、Microsoft Azure、Mistral AI 等都已基于 Vera Rubin 平台开展测试与部署。官方强调,新平台的目标不仅仅是提升峰值性能,更重要的是降低 Performance per Watt(每瓦性能成本)和 Token Cost(每 Token 生成成本),帮助 AI 工厂获得更高的整体运行效率。
从行业发展来看,这次官方博客释放的信号非常明确。随着 AI 产业进入以推理为主的新阶段,GPU 竞争已经不再局限于算力数字,而是扩展到了 CPU 协同、内存系统、互连网络、软件栈乃至整机架构。Rubin GPU 的公开,意味着 NVIDIA 正在重新定义 AI 基础设施的设计标准——把 GPU 从单一计算芯片,进一步演进为 AI Factory 的核心计算节点。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9