当一套天下产十万卡AI超集群完工不到一周即满载时,,,这不但仅是一个工程事业,,,更是中国算力生态从荒原走向雨林的生动注脚。。。。。。
文 | 华商韬略
2026年7月9日,,,郑州,,,国家超算互联网焦点节点。。。。。。
当曙光8000(登峰)的系统指示灯序次亮起时,,,许多人都不确定,,,这台集成了30亿颗电子元器件、互连线缆总长突破1600公里的“算力巨兽”,,,能否扛住真实天下的重量。。。。。。
谜底来得比所有人预想的都快。。。。。。
系统上线首周,,,直接进入应用满载运行的状态。。。。。。日均处理作业数突破15万个,,,单日处理作业峰值凌驾50万个——用户排队提交的盘算使命,,,让这个十万卡超集群的每一块芯片都忙得热火朝天。。。。。。
这在中国算力史上,,,险些是从未有过的情形。。。。。。
一般来说,,,新的算力集群从安排到形成战斗力,,,需要数月甚至更长的“预热期”——应用软件的适配、编译器的调试、用户的熟悉,,,每一个环节都是看不见的沟坎。。。。。。现在天,,,这些沟坎似乎一夜之间被填平了。。。。。。
已往几年,,,各地智算中心麋集建设,,,市场曾担心算力是否会泛起闲置。。。。。。而曙光8000恰恰完成了一次需求侧验证:市场并不缺少算力需求,,,真正稀缺的是好用、稳固且能被便捷挪用的优质算力。。。。。。
但结论不应停留在优质算力缺口上,,,真正的问题是:中国,,,这个一经在信息时代前二十年奋力追赶的国家,,,为何能在算力这个数字时代“新石油”的角逐中,,,凝聚起“十万卡”级别的磅礴实力??又怎样能短短一周就把应用需求塞满这样一艘算力巨轮??
谜底,,,藏在工业链的韧性里,,,藏在竞争范式的转移里,,,也藏在市场奇异的生态协同与这个国家苏醒的战略结构中。。。。。。
【01 工业链的整体冲锋】
十万卡算力高地拔地而起,,,不是某个天才的灵光一现,,,也不是一家企业的单兵突进。。。。。。它是一场有着最完整工业链、最辽阔应用市场、清晰政策谋划和深挚人才储备的系统性“会战”。。。。。。
第一,,,是工业链的“扎硬寨,,,打呆仗”。。。。。。
让我们把眼光投向整个算力工业链。。。。。。在安徽合肥,,,长鑫存储的工程师们,,,用了数年时间死磕一个使命——突破DRAM内存芯片的垄断。。。。。。在极端苛刻的清洁室里,,,他们与纳米级的物理极限屠杀,,,从19纳米到17纳米,,,每一步微缩,,,都意味着天文数字般的研发投入和难以想象的工艺挑战。。。。。。
在工业链下游,,,是DeepSeek这样的新锐实力。。。。。。他们向天下证实:大模子的事业,,,不但有堆砌算力这一条路,,,极致的算法优化,,,同样能让更少的“卡”迸发出更强的智能。。。。。。这实质上,,,是一种更智慧的算力使用方式,,,对缓解算力饥渴意义深远。。。。。。
从芯片设计、制造、封装,,,到服务器整机、高速互连网络,,,再到操作系统、数据库、大模子……中国正在艰难但坚定地,,,一段一段地补齐工业链的拼图。。。。。。
这就像建一座通天塔,,,每一块砖都必需自己烧制,,,其艰辛可想而知,,,可一旦建成,,,其基本之牢靠也非比寻常。。。。。。
第二,,,是市场的“大海里练游泳”。。。。。。
任何手艺,,,若是脱离了应用的土壤,,,最终都会枯萎。。。。。。而中国,,,恰恰拥有全球最重大、最重大、最饥渴的算力应用试验场。。。。。。
当具身智能在工厂车间里学着像人一样拧螺丝时,,,背后需要举行海量的实时感知、决议与控制训练。。。。。。当无数辆新能源汽车在路上飞驰,,,每一公里的自动驾驶数据,,,都要汇入后台的算力中心举行循环学习。。。。。。更不必说智能制造、金融风控、药物研发、气象展望……险些每一个行业的数字化、智能化转型,,,都在催生对算力的无尽需求。。。。。。
有一个数据越发直观:我国日均Token挪用量,,,已从2024年头的约千亿飙升到2026年的百万亿级别。。。。。。这种需求不是渐进增添,,,是指数级爆发。。。。。。
这种“拿来就用、用了就反馈、反馈了就迭代”的极速闭环,,,是中国市场给予本土算力企业最慷慨,,,也最残酷的馈赠。。。。。;;钕吕吹,,,都是能打硬仗的。。。。。。
第三,,,是顶层战略的“一张蓝图绘究竟”。。。。。。
“东数西算”工程启动,,,让西部丰裕的清洁能源,,,化为东部的数字生产力,,,针对中国算力失衡的战略结构随之最先。。。。。。而政策的远见,,,不但在于给钱给地,,,更在于构建一个重大的人才底座。。。。。。
已往十年,,,中国作育了全球规模最大的理工科人才步队。。。。。。那些在曙光8000监控屏幕后的年轻面目,,,那些在无尘车间里一待十几个小时的工艺工程师,,,那些为DeepSeek通宵达旦优化模子的算法天才……他们或许面容稚嫩,,,但眼神都一样坚定:在焦点手艺上挺直腰杆,,,就是我们这一代人的长征。。。。。。
【02 十万张卡的工程恶梦】
但十万卡超集群不是有了十万张卡就能建成的。。。。。。
难的不是数目,,,是规模带来的工程难题。。。。。。行业里有个说法:一千张卡是算术题,,,一万张卡是代数题,,,十万张卡是玄学题。。。。。。
这道玄学题,,,外洋的顶级玩家也刚刚摸到门槛。。。。。。
2024年,,,马斯克的xAI在美国孟菲斯建起Colossus超算,,,122天塞进十万张英伟达H100,,,速率震惊行业。。。。。。但建起来之后的贫困才是真正的难题。。。。。。外地电网供不上电,,,马斯克直接拉来数十台移动燃气轮机现场发电,,,由于排放问题还被外地住民抗议了一年多。。。。。。
Meta为训练Llama囤了几十万张GPU,,,但它自己宣布的手艺报告却显示:1.6万张H100的集群上,,,一次54天的大模子训练,,,意外中止了419次,,,相当于每三个小时坏一次,,,大部分故障来自GPU和显存。。。。。。
至于OpenAI和微软的“星际之门”妄想,,,妄想投资以千亿美元计,,,至今仍在图纸和工地之间。。。。。。
无限量的英伟达芯片、无限量的光模浚块、无限量的电,,,这些巨头想用钱把物理问题烫平。。。。。。浚可即便云云,,,他们的万卡集群依然被故障率、供电和散热折磨得够呛。。。。。。
而曙光8000的工程化难度直接拉满——英伟达的高端卡拿不到,,,外洋成熟方案用不了,,,每一个环节都得自己造。。。。。。但反过来,,,这也逼出了一套纷歧样的解法。。。。。。
十万张卡要协同事情,,,节点之间每秒钟都在交流海量数据。。。。。。外洋集群的标准谜底是光模浚块——一个十万卡集群要用掉数以十万计的光模浚块。。。。。。
但光模浚块有三个毛。。。。。。汗,,,一个顶级光模浚块要几百上千美元,,,十万卡集群要吃掉几十万个;;发热,,,自己就是耗电大户;;最要命的是娇气,,,它是整个集群里最容易坏的零部件之一。。。。。。
通过自研的scaleFabric网络架构和底层交流芯片,,,中科曙光极大地优化了互连效率,,,并用全新的冗余设计解决了大规模集群下光模浚块极易损坏导致训练中止的死穴。。。。。。
由此,,,一条数据从这台机械传到那台机械,,,全程只要0.93微秒——一眨眼的功夫,,,够它跑三十多万个往返。。。。。。即便某条线路出了问题,,,系统能在千分之几秒内自动切换到备用路径,,,训练使命基础感受不到。。。。。。Meta每三小时中止一次的那种恶梦,,,被从架构上拆掉了隐患。。。。。。
但连起十万张卡,,,不代表你就能用好十万张卡。。。。。。存储往往是一个容易被忽视的算力瓶颈——数据供不上,,,GPU就要空转,,,存储的性能直接决议了集群的数据吞吐能力。。。。。。曙光8000配备的ParaStor漫衍式存储,,,在2026年IO500拿下生产型榜单双料全球第一,,,并大幅刷新天下纪录,,,代表了业内商用存储系统的性能天花板。。。。。。
对十万卡规模而言,,,散热是又一浩劫题,,,古板风冷就像用电风扇吹炼钢炉。。。。。。对此,,,美国人的解法是硬堆电力,,,而中科曙光的解法是不铺张。。。。。。通过浸没相变液冷、湖水冷却等方案,,,曙光8000能把PUE(电能使用效率)压到1.04。。。。。。而全球大型数据中心的平均水平在1.5上下,,,最先进的AI机房也普遍在1.1以上。。。。。。同样一度电,,,中科曙光的机械醒目更多的活。。。。。。在“电力即算力”的时代,,,这就是竞争力自己。。。。。。
一台机械背后,,,芯片、整机、互连、存储、液冷、供电、调理软件,,,这些环节没有一个能单独买来,,,这是比造出一块芯片更难的系统工程能力。。。。。。
【03 供需错配的破解密码】
搞清了“怎样造出来”,,,接下来更主要的问题就是“为何被抢着用”。。。。。。
曙光8000能够首周满载,,,主要原因在于它精准掷中了算力需求的结构性厘革。。。。。。
AI工业正履历两股巨浪的交汇。。。。。。一是Token需求的指数级增添,,,百万亿级别的日均挪用量要求算力基础设施必需“开箱即用”。。。。。。二是科研范式正在爆发深刻厘革:AI for Science要求算力不可仅停留在低精度的大模子训练,,,还需要支持高精度的科学盘算与工程仿真。。。。。。
这正是古板算力中心的软肋。。。。。。已往,,,超算和智算往往脱离建设:超算善于双精度浮点运算,,,适合科学仿真;;智算善于低精度运算,,,适合AI训练。。。。。。这种破碎导致算力供应与真实需求泛起严重错配——科研用户苦于AI算力缺乏,,,智算中心又难以承接高精度仿真使命。。。。。。用户在双方排队,,,双方都吃不饱。。。。。。
曙光8000走了一条差别的路:原生超智融合。。。。。。
它摒弃了古板的分区方式,,,在统一硬件平台上支持从FP64双精度科学盘算到INT8低精度推理的全精度笼罩。。。。。。十万卡不再只是大模子训练的“大力出事业”,,,而是能够同时承接大模子训练、高通量推理、卵白质折叠模拟、万亿网格湍流仿真等重大使命的“算力工厂”。。。。。。
破解了一个要害的需求缺口——这才是曙光8000首周满载最深层的手艺原因。。。。。。它不是抢了别人的生意,,,而是填补了一个市场空缺。。。。。。
【04 只要在路上,,,就没有到不了的地方】
曙光8000证实晰国产十万卡“能不可做”、回覆了“有没有人用”的疑问。。。。。。同时一个更具标记性意义的信号已经泛起:中科曙光已与北京科学智能研究院启动第二套天下产十万卡系统的研制。。。。。。
第一套建成是手艺突破,,,第二套启动则标记着工业意义上的“产能扩张”最先泛起。。。。。。
当十万卡集群从“明星工程”变为“通例基建”,,,中国智算工业的真正磨练才刚刚最先:能否一连爆发高价值应用、一直优化本钱结构、突破差别算力中心之间的“数据孤岛”,,,形成真正高效协同的天下一体化算力网络——这才是决议十万卡系统能走多远的要害变量。。。。。。
我们在用别人意想不到的速率追赶,,,并且在追赶历程中走出了一条奇异的路径:用系统效率填补单点差别,,,用生态协同反抗手艺封锁,,,用市场纵深消化立异本钱。。。。。。
中国算力的崛起之路,,,不是从胜利走向胜利的凯歌,,,而是从一代人解决“有无问题”,,,走向另一代人解决“优劣问题”的接力。。。。。。
河南郑州的机房里,,,指示灯还在快速闪灼。。。。。。30亿颗元器件在统一个节奏里脉动,,,1600公里线缆里流淌着这个国家最智慧的盘算使命。。。。。。
而这,,,只是第一道曙光。。。。。。
接待关注【华商韬略】,,,识风云人物,,,读韬略传奇。。。。。。
版权所有,,,榨取私自转载
部分图片泉源于网络
如涉及侵权,,,请联系删除
“文天祥”亮相“赣超”赣州队绿茵场