(文/孙梅欣 编辑/吕栋)
在今年WAIC展会上,,,,,,超节点成为热词。。;;;;;;臅N腾950超节点、阿里磐久AL128超节点、沐曦的曦景S系列超节点、中兴通讯的OEX超节点......险些所有底座厂商,,,,,,都在谈论并且推出超节点产品。。。
作为英伟达在2023年就提出的看法,,,,,,超节点在行业内并不是一个新词汇。。。它通过将内部GPU举行高速总线互联,,,,,,支持起更大的盘算使命,,,,,,加速GPU之间的参数交流和数据同步,,,,,,缩短大模子的训练周期。。。
英伟达的这一开拓,,,,,,也将芯片厂商已往卖GPU的看法,,,,,,转变成为通过AI超等盘算机提供算力基础。。。
而国产芯片厂商纷纷入局,,,,,,这背后既有需求爆发的改变,,,,,,也有国产AI芯片厂商竞争正在从单点突破走向系统协同,,,,,,从芯片竞争走向AI基础设施竞争的工业逻辑转变。。。
“时间到了”,,,,,,超节焚烧了
当展台上泛起大宗小型数据中心一样的超节点柜机时,,,,,,大大都人都会有个疑问:什么是超节点?????
超节点的焦点,,,,,,是把原天职散的众多AI芯片,,,,,,通过超高速互联、统一软件和系统调理,,,,,,组成一台”超等盘算机”。。。其重点不在于有几多GPU的堆叠,,,,,,而是这些GPU之间能不可通过有用通讯,,,,,,像统一块高性能GPU一样协同事情。。。
之以是超节点在今年的WAIC上成为热词,,,,,,在行业人士看来,,,,,,是由于“时间到了”。。。
从行业趋势来说,,,,,,英伟达在提出超节点看法时就已经提到,,,,,,随着大模子从训练模子转向推理模子,,,,,,单块GPU的性能已经不敷用了,,,,,,边际效应正在逐渐展现,,,,,,需要通过系统集成之间的信息互联去支持更大的算力需求。。。
从海内现实来说,,,,,,海内芯片厂商也直面和英伟达单颗GPU之间保存较大差别。。。
一家头部国产芯片厂商的手艺工程师对视察者网坦言,,,,,,现在海内芯片厂商的制造能力,,,,,,和全球顶尖厂商之间仍有差别,,,,,,这其中有制造工艺、良率等各方面的差别。。。
“我们现在这一代的产品,,,,,,基本可以对标英伟达H20的产品,,,,,,但和英伟达下一代Rubin这一代的算力相比,,,,,,尚有1代到1.5代的差别。。。”该工程师坦言,,,,,,差别主要来自于生产工艺。。。
良率也是造成掣肘的问题。。。他提到,,,,,,一些全球顶尖厂商生产芯片,,,,,,100颗里有90颗都能使用,,,,,,良率更高铺张越少:“这些都需要终年累积下来的履历,,,,,,海内大部分厂商还做不到这一点。。。岂论工程照旧产线,,,,,,从50%的良率提升到90%的良率,,,,,,至少需要3-5年时间去填补。。。可是现在整体AI需求的爆发,,,,,,没有时间去干等手艺的提升,,,,,,因此需要通过其他的集成方式,,,,,,去提高整体的性能。。。”
古板上试图通过堆卡去填补性能上的缺乏,,,,,,但算力需求的急剧膨胀使得纯粹的堆卡集成已经不可提供有用算力,,,,,,而是需要芯片之间的互通互联带来整体算力的提升。。。
天数智芯副总裁石加圣举了一个例子:“一张内允许多、时间有限的试卷,,,,,,纵然能力很强的人,,,,,,也未必能够单独完玉成部问题。。。简朴增添做题人数,,,,,,若是各人各做各的、重复劳动,,,,,,最终效果未必理想。。。更有用的方式,,,,,,是把使命合理拆分,,,,,,让差别的人并行完成各自认真的部分,,,,,,同时通过高效的信息转达和统一调理,,,,,,实时汇总效果。。。只有这样,,,,,,个人能力才华真正转化为团队的整体能力。。。”
在这一点上,,,,,,去年华为的CloudMatrix384超节点AI集群就提供了一个很好的思绪,,,,,,到了今年,,,,,,则迅速在国产头部厂商之间铺开。。。
凭证WAIC展会上各家厂商提供的官方数据,,,,,,华为Atlas 950 SuperPoD能够提供1 EFLOPS FP8 、2 EFLOPS FP4算力;;;;;;曙光8000的单个盘算单位密度较其他超节点提升20倍,,,,,,同时接纳自研scaleFabric类IB原生RDMA无损高速互连手艺,,,,,,实现十万卡规模超高速稳固互连。。。
天数智芯的超节点则面向大模子训练与高并发推理场景,,,,,,以国产通用GPU为焦点,,,,,,实现144芯高速全互联,,,,,,通过高带宽互联、统一资源调理和软硬件协同优化,,,,,,提供稳固、可靠、可扩展的高质量算力;;;;;;燧原科技与中兴通讯相助的云燧ESL64-O超节点,,,,,,将Scale-up和Scale-out举行融合,,,,,,可横向扩展到16384集群超节点。。。
用工业链能力补足制程工艺差别
据展会上的事情职员透露,,,,,,现场展示的部分超节点机柜,,,,,,一个焦点算力单位的价钱就上亿元,,,,,,可见其研发和安排本钱之高。。。也就是说,,,,,,当下超节点岂论是研发、建设照旧使用,,,,,,本钱都极为高昂,,,,,,为何各大厂商仍然选择起劲投入?????
原因照旧在于,,,,,,市场关于算力的需求在急剧膨胀,,,,,,以及越来越多的企业需求最先从训练模子转向推理模子。。。
相较于模子训练,,,,,,面向大规模用户的在线推理服务通常需要同时知足高吞吐和低延迟要求。。。关于无法由单卡容纳的大模子,,,,,,以及接纳张量并行、专家并行或Prefill/Decode疏散的推理系统,,,,,,GPU之间需要频仍交流激活数据、Token或KV Cache,,,,,,因此对互联带宽和通讯延迟提出了更高要求。。。
这也是工业界生长超节点,,,,,,并从芯片、互联、软件栈和运维等层面举行系统级优化的主要原因之一。。。
石加圣提到,,,,,,随着大型模子的参数目和上下文长度一连增添,,,,,,单卡显存容量和盘算能力往往难以知足训练或高性能推理需求,,,,,,因此需要接纳数据并行、张量并行、流水线并行或专家并行等方式,,,,,,在多个GPU之间切分盘算使命。。。
古板集群主要通过高速网卡实现跨服务器通讯,,,,,,而超节点则进一步扩大了高带宽、低延迟的Scale-up互联域,,,,,,能够降低部分跨GPU通讯的开销。。。
他诠释,,,,,,目今越来越多的大型模子接纳MoE架构。。。专家并行会带来频仍的跨GPU Token路由和All-to-All通讯,,,,,,因此对互联带宽、通讯延迟和软件通讯效率提出了较高要求:“关于通讯麋集型的大规模MoE训练和推理使命,,,,,,超节点有望镌汰跨节点通讯开销,,,,,,并在知足一定使用率和营业规模的条件下提升整体性能与性价比。。。”
中科曙光手艺工程师王德志以为,,,,,,规模扩大以后,,,,,,系统重漂后不是简朴地线性放大。。。一方面,,,,,,大规模并行盘算需要整个系统高度协同,,,,,,任何网络或盘算短板都会使性能大幅损失,,,,,,必需包管规模扩展时性能效率近似线性增添;;;;;;另一方面随着部件数目的上升,,,,,,故障概率也会大幅增添,,,,,,进一步增添了包管系统可靠性的难度,,,,,,其中涉及到通讯、功耗、散热等一系列问题。。。
除了算力自己需求增添之外,,,,,,尚有一个海内的客观因素在于,,,,,,在国产芯片性能差别和被“卡脖子”确当下,,,,,,怎样通过系统性的解决方式,,,,,,把差别补回来。。。
摩尔线程副总裁马鉴就提到,,,,,,超节点自己应对的是“卡脖子”的问题:“厂商现实上要解决的是用更高的密度去解决单卡解决不了的问题,,,,,,通过系统上的提升去对标国际先进领先的超大规模的集群,,,,,,去训练出同样先进的模子。。。”
石加圣以为,,,,,,中国拥有规模极大的制造业基础,,,,,,以及很强的工业协同、系统集成和场景落地能力:“关于算力工业而言,,,,,,单颗芯片在工艺和性能上的前进十分主要,,,,,,但最终交付能力并不但取决于单个指标,,,,,,还取决于芯片、封装、存储、互联、软件栈和整机系统之间的协同。。。”
他以为,,,,,,面临部分环节的短板,,,,,,可以通过架构立异和系统级优化举行一定水平的缓解,,,,,,通过综合评估性能、功耗、本钱和工程重漂后等方式来确认替换方案的可行性。。。