凯时AG

3360亿晶体管!英伟达Rubin GPU细节首曝:智能体AI能效提升10倍

作者:陈世豪
宣布时间:2026-07-23 20:19:55
阅读量:979

3360亿晶体管!英伟达Rubin GPU细节首曝:智能体AI能效提升10倍

7月22日新闻, ,,,,在GTC 2026正式宣布之后, ,,,,英伟达(NVIDIA)克日首次完整果真了Rubin AI GPU架构的手艺细节。。。作为下一代AI数据中心平台的焦点盘算芯片, ,,,,Rubin不但肩负着接替Blackwell的使命, ,,,,也将成为未来Agentic AI(智能体AI)时代的主要算力基础。。。

凭证英伟达宣布的数据, ,,,,相比Blackwell架构, ,,,,Rubin在单位能耗下的Agentic AI推理吞吐量提升最高可达10倍。。。这一性能跃升主要来自三项要害架构立异:全新增强版Tensor Core(张量焦点)、 新一代HBM4高带宽内存子系统、第三代Transformer Engine(Transformer引擎)。。。

接纳双裸片设计, ,,,,集成3360亿颗晶体管

Rubin GPU接纳台积电(TSMC)3nm N3P制程工艺制造, ,,,,由两颗抵达光罩尺寸上限(Reticle Limit)的GPU裸片组成, ,,,,并通过英伟达自研的NV-HBI(High-Bandwidth Interface)高速互连手艺封装为一颗完整GPU。。。

整个Rubin GPU共集成约3360亿颗晶体管, ,,,,较Blackwell GB300增添约62%, ,,,,也是现在业内集成度最高的AI GPU之一。。。

从架构来看, ,,,,每颗Rubin GPU包括:8个GPC(Graphics Processing Cluster, ,,,,图形处理集群)、224个SM(Streaming Multiprocessor, ,,,,流式多处理器)、896个Tensor Core(张量焦点)。。。

凭证平均盘算, ,,,,每个GPC约拥有28个SM和112个Tensor Core。。。不过从官方框图来看, ,,,,Rubin现实上接纳了两种差别设置的GPC, ,,,,一种集成30个SM, ,,,,另一种集成26个SM。。。

每颗裸片内部包括4个GPC, ,,,,同时毗连:大容量漫衍式L2 Cache、Gigathread Engine、4组HBM4内存控制器(每裸片4096-bit)和NVLink接口。。。

别的, ,,,,Rubin还集成了:

PCIe Gen6控制器, ,,,,用于毗连主机CPU;;

第六代NVLink IO, ,,,,可提供最高3600GB/s GPU互连带宽;;

MIG(Multi-Instance GPU)控制器, ,,,,实现GPU资源切分;;

NVDEC视频解码单位;;

基于TEE-I/O(Trusted Execution Environment)的Confidential Computing(神秘盘算)能力, ,,,,可包管AI事情流中数据静态、传输及运行历程中的清静。。。

首次接纳HBM4, ,,,,带宽高达22TB/s

内存子系统是Rubin最大的升级之一。。。Rubin首次接纳HBM4高带宽内存, ,,,,共设置8组12-Hi堆叠, ,,,,总容量抵达288GB。。。

详细来看, ,,,,8组12-Hi HBM4, ,,,,每组容量36GB, ,,,,单颗DRAM容量3GB, ,,,,总容量288GB, ,,,,整体峰值带宽抵达22TB/s, ,,,,是现在英伟达最快的HBM内存方案。。。相比Blackwell约8TB/s带宽, ,,,,Rubin实现约2.8倍提升。。。

与此同时, ,,,,Rubin还配备升级版Tensor Memory Accelerator(TMA), ,,,,进一步优化GPU内部重大数据搬运效率。。。

整个数据传输系统包括:

HBM4:22TB/s

NVLink 6:GPU之间3600GB/s

NVLink-C2C:CPU-GPU之间1800GB/s

PCIe Gen6 x16:256GB/s

HBM4显著提升Token天生效率

随着大语言模子参数一直增添, ,,,,模子推理越来越受到内存带脱期制。。。英伟达体现, ,,,,现在AI推理普遍面临更长Context窗口、更大的KV Cache、更高并发Token天生。。。HBM4的大带宽可有用解决上述瓶颈。。。

详细而言, ,,,,容量提升意味着, ,,,,可容纳更大模子常驻显存、支持更长上下文窗口、支持更大的KV Cache、提高推理并发能力、镌汰KV Cache外存交流。。。

带宽提升则意味着, ,,,,提高Token逐个天生阶段的数据供应速率、阻止Tensor Core期待数据、提高GPU使用率。。。

别的, ,,,,升级后的TMA及内存局部性优化战略, ,,,,可进一步提高重大数据结构下的有用带宽使用率。。。

英伟达体现, ,,,,HBM4使Rubin能够支持未来多万亿参数模子、更长上下文推理以及高并发Agentic AI事情负载。。。

全新Tensor Memory Accelerator优化MoE模子推理

针对现在普遍应用的MoE(Mixture of Experts, ,,,,混淆专家)模子, ,,,,Rubin进一步增强了Tensor Memory Accelerator(TMA)。。。

随着MoE模子专家数目一直增添, ,,,,专家权重的数据定位与搬运成为新的性能瓶颈。。。

新版TMA通过优化形貌符(Descriptor)治理机制, ,,,,可更高效地定位和调理专家权重, ,,,,镌汰数据搬运开销。。。

同时, ,,,,Rubin新增Inline Descriptor支持, ,,,,使多个Tensor共享统一形貌信息, ,,,,仅需在运行历程中动态修改内存地点、Stride等参数即可完成调理。。。

英伟达体现, ,,,,这一刷新可使MoE模子在专家数目进一步增添后仍坚持较高扩展效率, ,,,,并将更多GPU盘算资源用于推理盘算, ,,,,从而提升整体吞吐能力。。。

Tensor Core吞吐翻倍, ,,,,Transformer推理进一步加速

Rubin另一项焦点升级来自Tensor Core。。。新版Tensor Core单个时钟周期可处理的数据量翻倍, ,,,,其主要通过扩大Tensor盘算中的K维数据处理能力实现。。。

以矩阵乘法(GEMM)为例:在Blackwell上需要执行4轮K循环, ,,,,而Rubin仅需2轮即可完成相同盘算。。。这不但提升盘算吞吐, ,,,,也降低了Kernel调理延迟。。。与此同时, ,,,,Rubin进一步优化了Transformer中的Attention盘算流程。。。

据官方先容, ,,,,其接纳Activation Sparsity(激活希罕)连系Adaptive Compression(自顺应压缩)手艺, ,,,,可将Attention Score压缩为结构化2:4希罕名堂, ,,,,仅生涯非零数据及对应元数据。。。

这样既镌汰Attention Score写入与存储开销, ,,,,也降低后续Attention盘算的数据传输量, ,,,,同时坚持最终输出仍为标准Dense名堂, ,,,,无需修改模子结构。。。

别的, ,,,,Rubin还提升了Softmax及指数运算(Exponential)性能。。。

差别精度下盘算能力提升如下:

FP32吞吐抵达GB300水平, ,,,,是GB200的2倍;;

BF16/FP16吞吐相比GB200提升4倍, ,,,,相比GB300提升2倍。。。

更低Kernel延迟, ,,,,更适合Agentic AI推理

Rubin还增强了GPU内部Kernel之间的调理协同能力。。。古板GPU通常需要期待上一阶段Kernel所有完成后再启动下一阶段盘算, ,,,,而Rubin允许后续Kernel在所需输入数据准备完成后即可提前启动。。。

这样能够镌汰GPU空闲时间、提高差别Kernel执行重叠度、提升流水线使用率。。。英伟达以为, ,,,,这关于Agentic AI推理尤为主要。。。

由于Agentic AI使命通常需要模子逐步天生Token, ,,,,各Kernel之间保存一连依赖关系, ,,,,Kernel间延迟将直接影响单用户Token天生速率(Tokens/s)。。。

DSX MaxLPS进一步优化AI数据中心能效

除了GPU自己, ,,,,Rubin平台也针对数据中心能效举行了大宗优化。。。

以Vera Rubin NVL72系统为例, ,,,,其新增了Dynamic Power Steering(动态功率调理)和Intelligent Power Smoothing(智能功率平滑)。。。系统通过集成储能?????, ,,,,可吸收GPU瞬时功率波动。。。

英伟达体现, ,,,,相较上一代平台平均功耗降低约10%, ,,,,50毫秒峰值功耗降低约20%。。。从而使整个AI服务器能够更稳固运行于最大功率区间, ,,,,提高整体Token输出效率。。。

别的, ,,,,英伟达还推出DSX OS操作系统, ,,,,其中集成DSX MaxLPS, ,,,,可统一治理GPU、机柜、液冷系统以及AI事情负载, ,,,,实现调理、生命周期治理及康健状态自动化。。。

官方数据显示, ,,,,在相同供电预算下, ,,,,DSX MaxLPS可支持安排约40%更多GPU资源, ,,,,从而进一步提升AI数据中心整体算力密度和推理吞吐能力。。。

从3360亿颗晶体管的双裸片设计, ,,,,到首次引入HBM4内存、增强版Tensor Core、第三代Transformer Engine, ,,,,以及围绕MoE模子、Agentic AI推理和数据中心能效所举行的一系列架构优化, ,,,,Rubin代表着英伟达AI GPU的一次周全升级。。。

可以看出, ,,,,相较于Blackwell主要面向大模子训练和通用推理, ,,,,Rubin的设计重点已经显着转向以智能体(Agentic AI)为代表的新一代AI应用场景, ,,,,通过提升Token天生效率、降低推理延迟、优化内存带宽使用率及提高单位能耗算力输出, ,,,,为未来更大规模、更高并发、更长上下文的大模子安排涤讪硬件基础。。。

编辑:芯智讯-浪客剑

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论, ,,,,请在这里揭晓您的看法、交流您的看法。。。

最新文章

热门文章

随机推荐

【网站地图】