英伟达公开Rubin GPU细节:3360亿晶体管,智能体AI性能提升10倍
英伟达最新发布的RubinGPU采用台积电3nm先进工艺,集成多达3360亿个晶体管,通过双Die与NV-HBI互联技术实现高效通信。其AI智能体性能相比上一代Blackwell架构提升10倍,配备288GBHBM4高带宽内存,带宽高达22TB/s,展现出强大的计算能力和性能优势。
英伟达今天正式公开了Rubin GPU的架构细节,信息量相当大。这款基于台积电3nm工艺的GPU,集成了3360亿个晶体管,在智能体AI性能方面,比Blackwell提升了整整10倍。可以说,这是英伟达在AI翻跟斗路线图上的又一次关键落子。
先从核心架构说起。Rubin GPU采用了台积电3nm(N3P)工艺制造,由两块光罩极限尺寸的Die组成,通过NVIDIA高带宽接口(NV-HBI)连接成统一封装。整个封装总计集成3360亿个晶体管,相比Blackwell GB300芯片,这个数字提升了62%。

每个Rubin GPU内部包含8个GPC(图形处理集群),总计224个SM(流式多处理器)和896个Tensor Cores。从方框图来看,GPC有两种类型:一种包含30个SM,另一种包含26个SM,这种非对称设计很有意思。
每个Die上配有4个GPC,连接着两组大型去中心化L2缓存、一个Gigathread Engine、四个HBM通道(每个芯片4096位)和一个NVLink接口。
互联方面也进行了全面升级——NVLink 6提供3600 GB/s的GPU间互联带宽,NVLink-C2C接口提供1800 GB/s的CPU到GPU通信带宽,而PCIe Gen6 x16通道则提供256 GB/s的主机连接带宽。这些数字意味着数据流动的效率将达到新的高度。
接下来是大家最关心的性能表现。根据英伟达最新数据,针对智能体AI工作负载,Rubin的单位能耗吞吐量达到了Blackwell的10倍。这个数字相当惊人。

注意,这个提升源自三项主要的架构变更:增强型张量核心(Tensor Cores)支持扩展精度、全新的HBM4内存子系统,以及第三代Transformer引擎。每一项都是关键。
重点说说内存系统。Rubin搭载了8个12-Hi堆栈的HBM4内存,总容量达到288 GB,单堆栈36 GB,峰值带宽高达22 TB/s。相比Blackwell的8 TB/s,提升了1.8倍。这意味着什么?更大的上下文窗口、更高的并发量,以及在逐令牌生成阶段,模型权重与KV状态可以高速移动,不再成为瓶颈。




Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















