凯时AG

2026-07-25 02:54:37 设为首页 | 加入珍藏

3360亿晶体管!英伟达Rubin GPU细节首曝:智能体AI能效提升10倍

2026-07-25 02:54:37 宣布 泉源:搜狐旅游 作者:何冠良 浏览:2121次

7月22日新闻,,,在GTC 2026正式宣布之后,,,英伟达(NVIDIA)克日首次完整果真了Rubin AI GPU架构的手艺细节。 。。。。。作为下一代AI数据中心平台的焦点盘算芯片,,,Rubin不但肩负着接替Blackwell的使命,,,也将成为未来Agentic AI(智能体AI)时代的主要算力基础。 。。。。。

凭证英伟达宣布的数据,,,相比Blackwell架构,,,Rubin在单位能耗下的Agentic AI推理吞吐量提升最高可达10倍。 。。。。。这一性能跃升主要来自三项要害架构立异:全新增强版Tensor Core(张量焦点)、 新一代HBM4高带宽内存子系统、第三代Transformer Engine(Transformer引擎)。 。。。。。

接纳双裸片设计,,,集成3360亿颗晶体管

Rubin GPU接纳台积电(TSMC)3nm N3P制程工艺制造,,,由两颗抵达光罩尺寸上限(Reticle Limit)的GPU裸片组成,,,并通过英伟达自研的NV-HBI(High-Bandwidth Interface)高速互连手艺封装为一颗完整GPU。 。。。。。

整个Rubin GPU共集成约3360亿颗晶体管,,,较Blackwell GB300增添约62%,,,也是现在业内集成度最高的AI GPU之一。 。。。。。

从架构来看,,,每颗Rubin GPU包括:8个GPC(Graphics Processing Cluster,,,图形处理集群)、224个SM(Streaming Multiprocessor,,,流式多处理器)、896个Tensor Core(张量焦点)。 。。。。。

凭证平均盘算,,,每个GPC约拥有28个SM和112个Tensor Core。 。。。。。不过从官方框图来看,,,Rubin现实上接纳了两种差别设置的GPC,,,一种集成30个SM,,,另一种集成26个SM。 。。。。。

每颗裸片内部包括4个GPC,,,同时毗连:大容量漫衍式L2 Cache、Gigathread Engine、4组HBM4内存控制器(每裸片4096-bit)和NVLink接口。 。。。。。

别的,,,Rubin还集成了:

PCIe Gen6控制器,,,用于毗连主机CPU;;;;

第六代NVLink IO,,,可提供最高3600GB/s GPU互连带宽;;;;

MIG(Multi-Instance GPU)控制器,,,实现GPU资源切分;;;;

NVDEC视频解码单位;;;;

基于TEE-I/O(Trusted Execution Environment)的Confidential Computing(神秘盘算)能力,,,可包管AI事情流中数据静态、传输及运行历程中的清静。 。。。。。

首次接纳HBM4,,,带宽高达22TB/s

内存子系统是Rubin最大的升级之一。 。。。。。Rubin首次接纳HBM4高带宽内存,,,共设置8组12-Hi堆叠,,,总容量抵达288GB。 。。。。。

详细来看,,,8组12-Hi HBM4,,,每组容量36GB,,,单颗DRAM容量3GB,,,总容量288GB,,,整体峰值带宽抵达22TB/s,,,是现在英伟达最快的HBM内存方案。 。。。。。相比Blackwell约8TB/s带宽,,,Rubin实现约2.8倍提升。 。。。。。

与此同时,,,Rubin还配备升级版Tensor Memory Accelerator(TMA),,,进一步优化GPU内部重大数据搬运效率。 。。。。。

整个数据传输系统包括:

HBM4:22TB/s

NVLink 6:GPU之间3600GB/s

NVLink-C2C:CPU-GPU之间1800GB/s

PCIe Gen6 x16:256GB/s

HBM4显著提升Token天生效率

随着大语言模子参数一直增添,,,模子推理越来越受到内存带脱期制。 。。。。。英伟达体现,,,现在AI推理普遍面临更长Context窗口、更大的KV Cache、更高并发Token天生。 。。。。。HBM4的大带宽可有用解决上述瓶颈。 。。。。。

详细而言,,,容量提升意味着,,,可容纳更大模子常驻显存、支持更长上下文窗口、支持更大的KV Cache、提高推理并发能力、镌汰KV Cache外存交流。 。。。。。

带宽提升则意味着,,,提高Token逐个天生阶段的数据供应速率、阻止Tensor Core期待数据、提高GPU使用率。 。。。。。

别的,,,升级后的TMA及内存局部性优化战略,,,可进一步提高重大数据结构下的有用带宽使用率。 。。。。。

英伟达体现,,,HBM4使Rubin能够支持未来多万亿参数模子、更长上下文推理以及高并发Agentic AI事情负载。 。。。。。

全新Tensor Memory Accelerator优化MoE模子推理

针对现在普遍应用的MoE(Mixture of Experts,,,混淆专家)模子,,,Rubin进一步增强了Tensor Memory Accelerator(TMA)。 。。。。。

随着MoE模子专家数目一直增添,,,专家权重的数据定位与搬运成为新的性能瓶颈。 。。。。。

新版TMA通过优化形貌符(Descriptor)治理机制,,,可更高效地定位和调理专家权重,,,镌汰数据搬运开销。 。。。。。

同时,,,Rubin新增Inline Descriptor支持,,,使多个Tensor共享统一形貌信息,,,仅需在运行历程中动态修改内存地点、Stride等参数即可完成调理。 。。。。。

英伟达体现,,,这一刷新可使MoE模子在专家数目进一步增添后仍坚持较高扩展效率,,,并将更多GPU盘算资源用于推理盘算,,,从而提升整体吞吐能力。 。。。。。

Tensor Core吞吐翻倍,,,Transformer推理进一步加速

Rubin另一项焦点升级来自Tensor Core。 。。。。。新版Tensor Core单个时钟周期可处理的数据量翻倍,,,其主要通过扩大Tensor盘算中的K维数据处理能力实现。 。。。。。

以矩阵乘法(GEMM)为例:在Blackwell上需要执行4轮K循环,,,而Rubin仅需2轮即可完成相同盘算。 。。。。。这不但提升盘算吞吐,,,也降低了Kernel调理延迟。 。。。。。与此同时,,,Rubin进一步优化了Transformer中的Attention盘算流程。 。。。。。

据官方先容,,,其接纳Activation Sparsity(激活希罕)连系Adaptive Compression(自顺应压缩)手艺,,,可将Attention Score压缩为结构化2:4希罕名堂,,,仅生涯非零数据及对应元数据。 。。。。。

这样既镌汰Attention Score写入与存储开销,,,也降低后续Attention盘算的数据传输量,,,同时坚持最终输出仍为标准Dense名堂,,,无需修改模子结构。 。。。。。

别的,,,Rubin还提升了Softmax及指数运算(Exponential)性能。 。。。。。

差别精度下盘算能力提升如下:

FP32吞吐抵达GB300水平,,,是GB200的2倍;;;;

BF16/FP16吞吐相比GB200提升4倍,,,相比GB300提升2倍。 。。。。。

更低Kernel延迟,,,更适合Agentic AI推理

Rubin还增强了GPU内部Kernel之间的调理协同能力。 。。。。。古板GPU通常需要期待上一阶段Kernel所有完成后再启动下一阶段盘算,,,而Rubin允许后续Kernel在所需输入数据准备完成后即可提前启动。 。。。。。

这样能够镌汰GPU空闲时间、提高差别Kernel执行重叠度、提升流水线使用率。 。。。。。英伟达以为,,,这关于Agentic AI推理尤为主要。 。。。。。

由于Agentic AI使命通常需要模子逐步天生Token,,,各Kernel之间保存一连依赖关系,,,Kernel间延迟将直接影响单用户Token天生速率(Tokens/s)。 。。。。。

DSX MaxLPS进一步优化AI数据中心能效

除了GPU自己,,,Rubin平台也针对数据中心能效举行了大宗优化。 。。。。。

以Vera Rubin NVL72系统为例,,,其新增了Dynamic Power Steering(动态功率调理)和Intelligent Power Smoothing(智能功率平滑)。 。。。。。系统通过集成储能???,,,可吸收GPU瞬时功率波动。 。。。。。

英伟达体现,,,相较上一代平台平均功耗降低约10%,,,50毫秒峰值功耗降低约20%。 。。。。。从而使整个AI服务器能够更稳固运行于最大功率区间,,,提高整体Token输出效率。 。。。。。

别的,,,英伟达还推出DSX OS操作系统,,,其中集成DSX MaxLPS,,,可统一治理GPU、机柜、液冷系统以及AI事情负载,,,实现调理、生命周期治理及康健状态自动化。 。。。。。

官方数据显示,,,在相同供电预算下,,,DSX MaxLPS可支持安排约40%更多GPU资源,,,从而进一步提升AI数据中心整体算力密度和推理吞吐能力。 。。。。。

从3360亿颗晶体管的双裸片设计,,,到首次引入HBM4内存、增强版Tensor Core、第三代Transformer Engine,,,以及围绕MoE模子、Agentic AI推理和数据中心能效所举行的一系列架构优化,,,Rubin代表着英伟达AI GPU的一次周全升级。 。。。。。

可以看出,,,相较于Blackwell主要面向大模子训练和通用推理,,,Rubin的设计重点已经显着转向以智能体(Agentic AI)为代表的新一代AI应用场景,,,通过提升Token天生效率、降低推理延迟、优化内存带宽使用率及提高单位能耗算力输出,,,为未来更大规模、更高并发、更长上下文的大模子安排涤讪硬件基础。 。。。。。

编辑:芯智讯-浪客剑

二是精准排查整治。 。。。。。进一步聚焦高层公共修建、老旧高层修建、正在维修刷新且有职员栖身使用的高层修建,,,进一步聚焦局部施工、外墙保温、消防设施、清静疏散、油烟管道、值班值守等方面的问题隐患,,,强化现场羁系,,,增强隐患排查的专业性和羁系执法的穿透力。 。。。。。对重大火灾隐患,,,挂牌督办、实地督导、强力整改。 。。。。。 -->

责任编辑:李仕莹    校对:陈盈秀

今日热门

  1. 国家防总针对山西、河南、陕西启动防汛四级应急响应
  2. 《乌苏里船歌》词作者胡小石先生逝世
  3. 光大期货:6月11日金融日报
  4. 成都与英国南约克郡企业共话市场机缘 盼碰撞相助火花
  5. 习近平出席2026天下人工智能大会暨人工智能全球治理高级别聚会开幕式
  6. 湖北巴东:霞染巫峡口 舟行水墨间
  7. 上海银行终审胜诉,,,姚振华等须全额送还25.8亿及罚息
  8. 4月中国企业信用水平一连坚持向好态势
  9. 直击台风上岸:风大雨急树被连根拔起
  10. 现场视频!台风“巴威”迫近 浙江舟山白沙岛掀起数米高巨浪

相关推荐

【网站地图】