凯时AG

环球热门新闻资讯
2026-07-22 09:03:27
首页 > 新闻 > 时政要闻 > 正文

千呼万唤始出来,,中科曙光怎样练就“十万卡”???

全球AI算力竞争已进入超大规模集群的综合较量时代。 。。

一方面,,微软、OpenAI、Meta等外洋巨头倾力打造十万卡专属算力集群,,试图垄断大模子、科学智能等前沿研发高地 ; ; ;;;;另一方面,,陪同大模子基础能力一连提升,,AI4S推动AI能力泛化叠加智能体加速生长,,催生重大算力需求,,能够恒久稳固运行、自主可控的十万卡级算力集群成为业界竞相攻坚的焦点目的。 。。

而摆在国产厂商眼前的难题却十分棘手:十万卡集群绝非万卡规模的简朴叠加,,多重手艺关卡环环相扣,,恣意一环短板都将导致整套超算系统难以施展设盘算力。 。。谁能率先突破行业桎梏,,搭建起海内首个十万卡AI集群???一场工业大会交出要害性答卷。 。。

“原生超智融合”,,海内首个十万卡AI超集群落地

7月10日,,光合组织2026智能盘算应用大会在郑州举行。 。 ; ; ;;;>刍崾贝,,中科曙光正式官宣海内首个天下产十万卡AI超集群——曙光8000(登峰)完工,,并同步接入国家超算互联网,,由此拉开了国产AI基础设施从万卡时代迈入十万卡阶段的序幕。 。。

近年来,,随着大模子、科学智能和智能体应用加速生长,,算力基础设施从千卡、万卡集群向更大规模演进。 。。面向高并发、高吞吐、多精度、多使命的复合负载,,十万卡级AI超集群不再只是数字看法,,而是下一代AI基础设施的主要入门能力。 。。可是,,万卡级算力底座从不是硬件数目简朴十倍叠加的“数字游戏”,,而是对全工业链、全手艺链路协同能力的系统大考,,背后藏着一套硬核的全链路自主工程解法。 。。

据悉,,曙光8000接纳“原生超智融合”手艺蹊径,,实现全类型盘算原生一体化融合,,面向高精度科学盘算和低精度智能盘算的复合需求,,支持FP64到INT8全精度,,笼罩科学盘算、大模子训练、AI推理、工业仿真等多类场景。 。。

十万卡集群所有完成安排,,标记着我国建陋习模领先、自主可控的通用型超智融合算力高地。 。。

算存传一体化,,买通性能瓶颈

在系统建设上,,曙光8000 具有“芯片、盘算、存储、网络、散热、应用、服务”全链路全自研AI基础设施能力。 。。

据悉,,海光等国产芯片为系统建设提供底层支持,,其中6款焦点芯片整体抵达国际先进水平,,筑牢算力基本。 。。

存储是算力释放的前置基础,,更是十万卡集群最容易袒露性能短板的一环。 。。

众所周知,,大模子训练、万亿级原子仿真等焦点营业运行时代,,会一连产出PB级超大文件与海量碎片化日志,,通俗漫衍式存储系统极易陷入元数据梗塞、带宽分配失衡、会见延迟陡增等问题。 。。当大宗算力硬件空等数据调理,,最终将普遍陷入硬件安排拉满,,现实算力使用率缺乏的逆境。 。。

此次,,曙光8000搭载自研ParaStor漫衍式存储系统,,并在2026全球IO500榜单中一举获得生产型全节点和10节点性能“双榜第一”。 。。这份榜单以真实营业负载完成实测,,是权衡商用存储工程落地实力的权威标准。 。。

行业普遍面临的逆境是,,算力硬件性能一连迭代翻倍,,但集群互联网络带宽的升级速率却严重滞后。 。。有数据支持,,千卡级人工智能训练中通讯时间占比可达30%以上,,在超大规模模子或接纳重大并行战略(如张量并行、流水线并行等)的训练场景,,通讯占比甚至抵达50%至70%,,网络已成为制约算力释放的“隐形门槛”。 。。

为解决这一痛点,,今年3月,,中科曙光推出首款国产400G原生无损RDMA高速网络——scaleFabric,,该手艺对标国际顶尖同类产品手艺水平,,可适配超大规模盘算基础设施网络需求,,有用填补国产集群“高速互联”手艺空缺。 。。

scaleFabric接纳原生无损RDMA高速网络手艺,,从底层SerDes IP、交流芯片到网卡、交流机及治理软件实现全链路自主研发。 。。其接纳原生信用基流控机制,,包管数据传输无丢包,,可支持十万卡级规模组网,,适配超大型算力集群的建设需求,,且具备毫秒级链路故障恢复能力,,不随网络规模增添而转变,,包管大规模集群恒久稳固运行。 。。

绿色底座+“智慧大脑”,,一站式平台买通“孤岛”

算力密度一连走高,,高密度散热与绿色低碳是十万卡集群规 ; ; ;;;;粗频挠残栽际,,也是契合国家算电协同、绿色算力政策的焦点工程要点。 。。

通常而言,,古板风冷、冷板式液冷的机柜承载能力保存显着天花板,,无法知足十万卡集群超高单机柜算力密度的安排需求。 。。与此同时,,风冷架构机房空间占用量大,,整体能源使用效率偏低,,恒久运营会爆发高额用电本钱 ; ; ;;;;而外洋液冷专用冷媒手艺恒久受专利约束,,供应链自主可控性缺乏。 。。

曙光8000接纳整机柜浸没相变液冷方案,,单机柜稳固支持MW级功率密度,,搭配自研国产绝缘冷媒与金刚石铜合金导热质料,,散热效率远超古板方案。 。。整套系统可实现整年自然冷却,,数据中心PUE低至1.04 ; ; ;;;;别的,,依托高压直流电直接入柜方案,,提升供电系统整体效率,,输出电流可快速响应算力负载波动,,无时延匹配营业动态转变,,供电架构可向更高电压品级演进,,适配未来算力密度一连提升的需求。 。。高密度、低能耗、易运维三大优势,,为曙光8000扫清十万卡集群绿色落地的能耗障碍。 。。

若是说芯、存、网、冷组成了集群硬件基础,,那么Gridview7.0一站式智能化算力治理平台则是十万卡系统的“调理大脑”,,其有用解决了超大集群软件层面碎片化、运维繁重、算力使用率偏低的行业通病。 。。

集微网相识,,Gridview7.0焦点为MetaStack+K8s双融合调理架构、科研+运维双智能体,,依托全栈国产化硬件适配与OneScience自然语言交互能力,,买通超算高精度仿真、AI大模子训推混淆算力统一调理,,实现科研、运维全流程自动化,,算力资源按需调配,,彻底买通“算力孤岛”。 。。

该平台面向十万卡级超大集群提供全场景管控能力,,内置数百款行业应用模板,,同时具备支持十万卡线性扩展的自研调理优化、超节点整机柜适配、6大行业科研智能体、分级清静保密、超算互联网联动运营等专属能力,,解决调理拥堵、运维重大、算力使用率低等痛点,,大幅降低大规模国产算力集群使用门槛,,让十万卡算力转化为真正可挪用的标准化“生产力”。 。。

全链路闭环能力,,从树模走向规 ; ; ;;;;

拆解曙光8000整套全栈手艺架构不难看出,,其行业刷新意义不在于十万张加速卡的硬件堆砌,,而在于完成“芯、算、存、网、冷、管、软”各环节全链路自研、深度协同、闭环验证的完整系统工程,,这也是区分“硬件拼集集群”与“标准化十万卡智算底座”的焦点标记。 。。

放眼全球算力竞争,,外洋十万卡集群系统高度关闭,,软硬件绑定简单生态,,难以适配海内本土化科研场景与数据清静规范 ; ; ;;;;海内大都厂商仅能实现单点硬件突破,,缺少端到端协同优化能力,,无法支持十万卡级使命恒久稳固运行。 。。

现在,,在十万卡焦点节点上,,曙光8000已完成300余项重点应用优化,,以及60+项目半机规模应用、20+整机规模应用、15+GB(戈登贝尔奖)量级超大规模应用适配优化,,涵盖大模子、机械人、汽车、立异药、新质料、量子盘算、天文气象等20+领域,,验证了焦点节点在大规模、高负荷科研使命中的稳固性与可靠性。 。。在重点大应用方面,,已实现卵白质折叠模拟、万亿原子级水分子动力学模拟百万亿网格湍流模拟等,,用真实工业案例验证系统综合实力。 。。

曙光8000的落地有望发动上游芯片、零部件,,中游整机、软件,,下游行业应用等全工业链协同生长,,并依托光合组织工业链同伴,,输出标准化十万卡建设方案。 。。大会时代,,中科曙光与北京科学智能研究院签约,,启动第二套天下产十万卡算力系统研制。 。。

在全球AI工业离别纯粹追逐算力规模的粗放生长阶段,,进入看重系统效率、落地实效的理性竞争周期下,,算力基础设施的评判标准不再是加速卡数目、单卡峰值,,而是综合系统运行效率、绿色低碳水平、全场景适配能力与自主可控工业链成熟度,,十万卡AI超集群将逐步成为基础科研、高端制造、数字工业的标配基础设施。 。。

目今,,中科曙光十万卡集群正重新界说全球算力赛道的竞争标尺——万卡集群可依赖硬件集成快速成型,,而十万卡超大规模算力系统却离不起源到端全栈自研手艺作为稳固运行的焦点支柱,,算力基础设施的角逐,,归根究竟是系统工程综合能力的较量。 。。从包管工业链自主清静,,到驱动基础科学原始立异,,全链路自研的国产算力底座肩负着要害底层使命,,正一直加固我国AI工业的生长基本,,为新质生产力培育提供焦点算力引擎。 。。

——敢于善于斗争,,始终坚持必胜信心。 。。我们党坚持和发挥不怕牺牲、英勇斗争的精神,,为了人民、国家、民族,,为了理想信心,,披荆斩棘、砥砺前行,,无论仇人怎样强盛、蹊径怎样艰险、挑战怎样严肃,,总是绝不畏惧、绝不退缩,,以听凭风雨来袭、我自岿然不动的钢铁意志鼓舞天下人民一直从胜利走向胜利。 。。

责任编辑:吕上枝

【网站地图】