3360亿晶体管!英伟达Rubin GPU细节首曝:智能体AI能效提升10倍
7月22日新闻,,,,,,在GTC 2026正式宣布之后,,,,,,英伟达(NVIDIA)克日首次完整果真了Rubin AI GPU架构的手艺细节。。。。作为下一代AI数据中心平台的焦点盘算芯片,,,,,,Rubin不但肩负着接替Blackwell的使命,,,,,,也将成为未来Agentic AI(智能体AI)时代的主要算力基础。。。。
凭证英伟达宣布的数据,,,,,,相比Blackwell架构,,,,,,Rubin在单位能耗下的Agentic AI推理吞吐量提升最高可达10倍。。。。这一性能跃升主要来自三项要害架构立异:全新增强版Tensor Core(张量焦点)、 新一代HBM4高带宽内存子系统、第三代Transformer Engine(Transformer引擎)。。。。
接纳双裸片设计,,,,,,集成3360亿颗晶体管
Rubin GPU接纳台积电(TSMC)3nm N3P制程工艺制造,,,,,,由两颗抵达光罩尺寸上限(Reticle Limit)的GPU裸片组成,,,,,,并通过英伟达自研的NV-HBI(High-Bandwidth Interface)高速互连手艺封装为一颗完整GPU。。。。
整个Rubin GPU共集成约3360亿颗晶体管,,,,,,较Blackwell GB300增添约62%,,,,,,也是现在业内集成度最高的AI GPU之一。。。。
从架构来看,,,,,,每颗Rubin GPU包括:8个GPC(Graphics Processing Cluster,,,,,,图形处理集群)、224个SM(Streaming Multiprocessor,,,,,,流式多处理器)、896个Tensor Core(张量焦点)。。。。
凭证平均盘算,,,,,,每个GPC约拥有28个SM和112个Tensor Core。。。。不过从官方框图来看,,,,,,Rubin现实上接纳了两种差别设置的GPC,,,,,,一种集成30个SM,,,,,,另一种集成26个SM。。。。
每颗裸片内部包括4个GPC,,,,,,同时毗连:大容量漫衍式L2 Cache、Gigathread Engine、4组HBM4内存控制器(每裸片4096-bit)和NVLink接口。。。。
别的,,,,,,Rubin还集成了:
PCIe Gen6控制器,,,,,,用于毗连主机CPU;;;;;
第六代NVLink IO,,,,,,可提供最高3600GB/s GPU互连带宽;;;;;
MIG(Multi-Instance GPU)控制器,,,,,,实现GPU资源切分;;;;;
NVDEC视频解码单位;;;;;
基于TEE-I/O(Trusted Execution Environment)的Confidential Computing(神秘盘算)能力,,,,,,可包管AI事情流中数据静态、传输及运行历程中的清静。。。。
首次接纳HBM4,,,,,,带宽高达22TB/s
内存子系统是Rubin最大的升级之一。。。。Rubin首次接纳HBM4高带宽内存,,,,,,共设置8组12-Hi堆叠,,,,,,总容量抵达288GB。。。。
详细来看,,,,,,8组12-Hi HBM4,,,,,,每组容量36GB,,,,,,单颗DRAM容量3GB,,,,,,总容量288GB,,,,,,整体峰值带宽抵达22TB/s,,,,,,是现在英伟达最快的HBM内存方案。。。。相比Blackwell约8TB/s带宽,,,,,,Rubin实现约2.8倍提升。。。。
与此同时,,,,,,Rubin还配备升级版Tensor Memory Accelerator(TMA),,,,,,进一步优化GPU内部重大数据搬运效率。。。。
整个数据传输系统包括:
HBM4:22TB/s
NVLink 6:GPU之间3600GB/s
NVLink-C2C:CPU-GPU之间1800GB/s
PCIe Gen6 x16:256GB/s
HBM4显著提升Token天生效率
随着大语言模子参数一直增添,,,,,,模子推理越来越受到内存带脱期制。。。。英伟达体现,,,,,,现在AI推理普遍面临更长Context窗口、更大的KV Cache、更高并发Token天生。。。。HBM4的大带宽可有用解决上述瓶颈。。。。
详细而言,,,,,,容量提升意味着,,,,,,可容纳更大模子常驻显存、支持更长上下文窗口、支持更大的KV Cache、提高推理并发能力、镌汰KV Cache外存交流。。。。
带宽提升则意味着,,,,,,提高Token逐个天生阶段的数据供应速率、阻止Tensor Core期待数据、提高GPU使用率。。。。
别的,,,,,,升级后的TMA及内存局部性优化战略,,,,,,可进一步提高重大数据结构下的有用带宽使用率。。。。
英伟达体现,,,,,,HBM4使Rubin能够支持未来多万亿参数模子、更长上下文推理以及高并发Agentic AI事情负载。。。。
全新Tensor Memory Accelerator优化MoE模子推理
针对现在普遍应用的MoE(Mixture of Experts,,,,,,混淆专家)模子,,,,,,Rubin进一步增强了Tensor Memory Accelerator(TMA)。。。。
随着MoE模子专家数目一直增添,,,,,,专家权重的数据定位与搬运成为新的性能瓶颈。。。。
新版TMA通过优化形貌符(Descriptor)治理机制,,,,,,可更高效地定位和调理专家权重,,,,,,镌汰数据搬运开销。。。。
同时,,,,,,Rubin新增Inline Descriptor支持,,,,,,使多个Tensor共享统一形貌信息,,,,,,仅需在运行历程中动态修改内存地点、Stride等参数即可完成调理。。。。
英伟达体现,,,,,,这一刷新可使MoE模子在专家数目进一步增添后仍坚持较高扩展效率,,,,,,并将更多GPU盘算资源用于推理盘算,,,,,,从而提升整体吞吐能力。。。。
Tensor Core吞吐翻倍,,,,,,Transformer推理进一步加速
Rubin另一项焦点升级来自Tensor Core。。。。新版Tensor Core单个时钟周期可处理的数据量翻倍,,,,,,其主要通过扩大Tensor盘算中的K维数据处理能力实现。。。。
以矩阵乘法(GEMM)为例:在Blackwell上需要执行4轮K循环,,,,,,而Rubin仅需2轮即可完成相同盘算。。。。这不但提升盘算吞吐,,,,,,也降低了Kernel调理延迟。。。。与此同时,,,,,,Rubin进一步优化了Transformer中的Attention盘算流程。。。。
据官方先容,,,,,,其接纳Activation Sparsity(激活希罕)连系Adaptive Compression(自顺应压缩)手艺,,,,,,可将Attention Score压缩为结构化2:4希罕名堂,,,,,,仅生涯非零数据及对应元数据。。。。
这样既镌汰Attention Score写入与存储开销,,,,,,也降低后续Attention盘算的数据传输量,,,,,,同时坚持最终输出仍为标准Dense名堂,,,,,,无需修改模子结构。。。。
别的,,,,,,Rubin还提升了Softmax及指数运算(Exponential)性能。。。。
差别精度下盘算能力提升如下:
FP32吞吐抵达GB300水平,,,,,,是GB200的2倍;;;;;
BF16/FP16吞吐相比GB200提升4倍,,,,,,相比GB300提升2倍。。。。
更低Kernel延迟,,,,,,更适合Agentic AI推理
Rubin还增强了GPU内部Kernel之间的调理协同能力。。。。古板GPU通常需要期待上一阶段Kernel所有完成后再启动下一阶段盘算,,,,,,而Rubin允许后续Kernel在所需输入数据准备完成后即可提前启动。。。。
这样能够镌汰GPU空闲时间、提高差别Kernel执行重叠度、提升流水线使用率。。。。英伟达以为,,,,,,这关于Agentic AI推理尤为主要。。。。
由于Agentic AI使命通常需要模子逐步天生Token,,,,,,各Kernel之间保存一连依赖关系,,,,,,Kernel间延迟将直接影响单用户Token天生速率(Tokens/s)。。。。
DSX MaxLPS进一步优化AI数据中心能效
除了GPU自己,,,,,,Rubin平台也针对数据中心能效举行了大宗优化。。。。
以Vera Rubin NVL72系统为例,,,,,,其新增了Dynamic Power Steering(动态功率调理)和Intelligent Power Smoothing(智能功率平滑)。。。。系统通过集成储能??,,,,,,可吸收GPU瞬时功率波动。。。。
英伟达体现,,,,,,相较上一代平台平均功耗降低约10%,,,,,,50毫秒峰值功耗降低约20%。。。。从而使整个AI服务器能够更稳固运行于最大功率区间,,,,,,提高整体Token输出效率。。。。
别的,,,,,,英伟达还推出DSX OS操作系统,,,,,,其中集成DSX MaxLPS,,,,,,可统一治理GPU、机柜、液冷系统以及AI事情负载,,,,,,实现调理、生命周期治理及康健状态自动化。。。。
官方数据显示,,,,,,在相同供电预算下,,,,,,DSX MaxLPS可支持安排约40%更多GPU资源,,,,,,从而进一步提升AI数据中心整体算力密度和推理吞吐能力。。。。
从3360亿颗晶体管的双裸片设计,,,,,,到首次引入HBM4内存、增强版Tensor Core、第三代Transformer Engine,,,,,,以及围绕MoE模子、Agentic AI推理和数据中心能效所举行的一系列架构优化,,,,,,Rubin代表着英伟达AI GPU的一次周全升级。。。。
可以看出,,,,,,相较于Blackwell主要面向大模子训练和通用推理,,,,,,Rubin的设计重点已经显着转向以智能体(Agentic AI)为代表的新一代AI应用场景,,,,,,通过提升Token天生效率、降低推理延迟、优化内存带宽使用率及提高单位能耗算力输出,,,,,,为未来更大规模、更高并发、更长上下文的大模子安排涤讪硬件基础。。。。
编辑:芯智讯-浪客剑
文章点评
未盘问到任何数据!
揭晓谈论
◎接待加入讨论,,,,,,请在这里揭晓您的看法、交流您的看法。。。。