文|机械最前线
"大脑"正在取代"身体",,,,,成为具身智能行业新的竞争焦点。。。。。
凭证统计数据,,,,,2026年上半年海内具身智能赛道总融资额达437.66亿元,,,,,其中以具身大脑为焦点营业的"大脑派"公司融资222.53亿元,,,,,占比高达50.8%;;;;;而以机械人本体整机为焦点的"本体派"公司同期融资仅56亿元,,,,,占比12.8%。。。。。
一级市场的资源风向,,,,,清晰地指向了这一转变。。。。。而这种转向并非没有缘由,,,,,宇树的机械人可以在舞台上后空翻,,,,,智元的机械臂能在实验室里拧螺丝,,,,,但面临传送带上微微偏移的包裹、货架上被主顾挪动过的商品,,,,,甚至是一扇透明的玻璃门,,,,,这些看似灵巧的"身体"的体现经常大打折扣。。。。。
硬件越做越强,,,,,真实场景却越"跑"越费力。。。。。行业用两年时间完成了本体能力的快速迭代,,,,,却在不经意间撞上了一堵更厚的"墙"。。。。。
01"借脑"or"造脑"
2023年早春,,,,,一则新闻的泛起引起了整个科技圈的震惊。。。。。
3月,,,,,OpenAI宣布了多模态预训练大模子GPT-4,,,,,与此前的版内情比,,,,,GPT-4具备强盛的识图能力,,,,,文字输入限制也提升至2.5万字;;;;;回覆准确性也显著提升,,,,,还能够天生歌词、创意文本从而实现气概转变。。。。。
不少公司和行业最先面临被大模子重塑的"运气"。。。。。Figure AI,,,,,这家获得微软、英伟达和OpenAI巨额投资的独角兽也不破例。。。。。
思量到与其死磕从零训练,,,,,不如将通用大模子的认知能力与机械人本体深度连系。。。。。2024年头,,,,,Figure AI与OpenAI告竣相助协议,,,,,后者为其提供先进的语言模子支持,,,,,资助机械人实现对话、推理和妄想等功效。。。。。
这个决议逻辑在其时险些无可指摘,,,,,事实,,,,,互联网已经训练出了能够明确重大语义的模子,,,,,为什么不直接拿来用。。。。。
以是,,,,,以后很长一段时间里,,,,,这条"拿来主义蹊径"成为行业主流,,,,,也就是用面向数字内容创作的视频天生模子做底座,,,,,再通过微调适配机械人。。。。。
Physical Intelligence的π系列、英伟达的GR00T N1.7、Google的Gemini Robotics,,,,,以及海内绝大大都具身智能团队,,,,,都在用通用大模子做底座。。。。。
这套要领论的优势显而易见,,,,,研发周期短、可复用现成的多模态能力,,,,,并且在实验室和标准化的演示场景中体现亮眼,,,,,但问题在机械人进入真真相形时最先袒露。。。。。
物流客栈的传送带速率会有细微波动;;;;;药房货架上的药品包装并非完全统一;;;;;工厂车间里的光照条件随时转变……这些在人类看来微缺乏道的差别,,,,,却足以让通过迁徙学习逐步适配机械人使命的模子失效。。。。。
(图源:仙工智能)
基础原因在于,,,,,将原本用于明确天下的模子刷新为可以执行使命的机械人大脑,,,,,它的训练目的实质上仍然围绕展望下一帧或者明确语义,,,,,而机械人需要回覆的焦点问题是"我的行动会让天下爆发什么改变"。。。。。
前者捕获相关性,,,,,后者需要建设因果关系,,,,,两者之间保存结构性错配。。。。。
更深层的矛盾在于数据的获。。。。。,,,大模子可以吞噬互联网上万亿级的文本和图片,,,,,但机械人没有属于自己的互联网。。。。。
真实物理天下的交互数据只能依赖遥操作一帧一帧收罗,,,,,本钱高昂、效率低下。。。。。阻止2026年头,,,,,全球合规、可用的真实物理交互数据总量仅约50万小时,,,,,缺乏大语言模子训练数据的两万分之一,,,,,缺口凌驾99%。。。。。正是这些矛盾的叠加,,,,,最终催生了行业对底层架构、数据和预训练目的的重新审阅。。。。。
02一个无法绕过的参照系
当"大脑"成为具身智能的决胜点,,,,,各路玩家正在用差别的方式争取这个位置。。。。。从目今名堂来看,,,,,大致可以归为三类。。。。。
第一类是外洋大模子公司,,,,,它们试图打造跨本体、跨使命的通用大脑。。。。。
好比Skild AI主要聚焦通用天下模子研发,,,,,焦点能力是让机械人在真实物理情形中实现零样本使命泛化;;;;;Physical Intelligence则走VLA蹊径,,,,,依附海量真机数据在跨本体泛化上建设了壁垒……这些公司的配合特征是押注"一个模子通吃"的通用蹊径。。。。。
第二类是科技巨头,,,,,它们致力于做机械人时代的基础设施,,,,,是最靠近"底层平台"的公司。。。。。
好比英伟达推出的Isaac GR00T,,,,,被官方界说为面向通用人形机械人的开放参考平台;;;;;Google DeepMind宣布的Gemini Robotics,,,,,依托多模态大模子的明确能力,,,,,试图用互联网知识补足机械人知识;;;;;华为则选择不做本体而专注做行业的手艺底座,,,,,推出了CloudRobo具身智能开发平台,,,,,定位一站式公共开发工具链……
第三类是海内的一些具身智能公司,,,,,它们的路径越发多元。。。。。
逐际动力提出了"模子只是手艺,,,,,系统才是真大脑"的看法,,,,,宣布具身大脑系统LimX COSA 0.5,,,,,把认知、手艺和运控拆成三层;;;;;自变量机械人则走端到端蹊径,,,,,其WALL-A模子接纳端到端VLA操作大模子架构,,,,,与天下模子深度融合,,,,,实现具身多模态头脑链……
而大脑赛道内部的分化同样强烈,,,,,据"创业最前线"报道,,,,,VLA(视觉-语言-行动)模子一口吃掉了42%的资金,,,,,天下模子占27%,,,,,数据基础设施占20%,,,,,端侧芯片占11%。。。。。
VLA蹊径继续视觉语言模子的语义明确能力,,,,,把视察、语言和行动直接毗连起来,,,,,成熟、直接、离真实落地更近,,,,,因此成为行业主流。。。。。
不过,,,,,随着越来越多人发明,,,,,VA蹊径把视频展望、天下模子引入机械人控制,,,,,把未来场景演化作为行动天生的一部分,,,,,这个"厥后者"最先获得越来越多关注。。。。。
两条蹊径各有拥趸,,,,,而真正值得关注的,,,,,是那些试图跳出两派之争、从更底层重新思索问题的玩家,,,,,蚂蚁灵波即是其中之一。。。。。
作为蚂蚁集团面向具身智能与机械人工业设立的焦点营业载体,,,,,其在2026年7月7日—10日一口吻宣布六款模子,,,,,组成其"全栈大脑2.0"系统,,,,,并将在一周内麋集开源。。。。。其中,,,,,首个具身原生天下行动模子LingBot-VA 2.0模子的宣布,,,,,标记着机械人基础模子正式从"基于数字天下模子构建"到"面向物理天下原生设计"的要害转变。。。。。
(LingBot-World 2.0,,,,,图源:蚂蚁灵波官方网站)
蚂蚁灵波的焦点主张是"具身原生",,,,,这种做法的与众差别之处在于,,,,,它拒绝把通用大模子看成现成的脑壳接上一具身体,,,,,而是从物理天下的运行纪律出发,,,,,重新设计了感知、推演和执行三个环节的底层逻辑。。。。。
手艺好欠好,,,,,落地场景最有说服力。。。。。在工业物流场景,,,,,蚂蚁灵波与乐聚相助,,,,,将VLA2.0安排到物流分拣产线;;;;;在零售医药场景,,,,,蚂蚁灵波与国大药房相助落地人机协同药房方案;;;;;在硬件产品化场景,,,,,蚂蚁灵波与奥比中光相助,,,,,将自身的视觉感知能力与深度相机硬件连系,,,,,推出更适合机械人场景的深度感知产品……现在LingBot-VLA 2.0 已经适配17家厂商、20余种构型,,,,,单臂、双臂、双足和轮式都能笼罩。。。。。
(图源:蚂蚁灵波)
只管蚂蚁灵波首席科学家沈宇军也坦承道,,,,,VLA是目今更容易落地的主流蹊径,,,,,VA/WAM补上了动态建模和未来展望;;;;;但未来不会是"VA或者VLA的天下",,,,,而会泛起一个"1+1>2"的新模子。。。。。
可是无论怎样,,,,,"具身原生"所代表的从物理天下出发重新设计的思绪,,,,,正在成为行业讨论中一个无法绕过的参照系。。。。。
03"大脑竞赛"的下一个隘口
手艺蹊径之争最终要在真实场景中接受磨练。。。。。
2025年中国具身智能市场规模已达9150亿元,,,,,同比增添20.4%,,,,,剖析师展望2026年将进一步增添至10904亿元。。。。。具身智能工业化的"元年"已至的声音,,,,,一时之间甚嚣尘上。。。。。
不过,,,,,这个"元年"背后,,,,,一台人形机械人的硬件采购本钱动辄数十万元,,,,,绝大大都服务场景难以在合理周期内收回投入。。。。。再加上,,,,,在重大的真实物理天下中,,,,,缺乏高质量数据支持的机械人往往难以实现"好用",,,,,这个工业化"答卷"并欠好写。。。。。
并且,,,,,由于差别机械人本体之间差别重大,,,,,单台机型需要工程师定制调试一套专属算法,,,,,换一台机械人、换一套场景就要重新训练适配,,,,,非标开发本钱居高不下。。。。。阻止现在,,,,,各家要么有脑无身、有身无脑,,,,,真正具备"跨本体适配能力"的玩家,,,,,屈指可数。。。。。
若是换一种身体就要重新训练一套模子,,,,,换一个场景就要重新安排一次,,,,,这种碎片化的开发模式无疑是具身智能规模;;;;涞刈畲蟮囊性本钱。。。。。
别的,,,,,具身智能行业仍处于早期阶段,,,,,智元联合首创人、总裁兼首席手艺官彭志辉在WAIC 2026上也体现:"现在,,,,,行业对具身大脑的手艺路径尚未收敛,,,,,两三年可能就会泛起新架构,,,,,很难预判手艺的唯一谜底。。。。。"
跨本体的恒久稳固性、开源生态能否形成可一连的正向循环、真实场景数据的规模和质量是否足以支持模子的一连进化,,,,,或许还需要更长时间的验证。。。。。
但资源市场的信号已经足够清晰,,,,,大脑派公司的融资节奏快到平均一个月一轮,,,,,甚至有企业两轮融资距离只有两周。。。。。
资源的涌入自己也意味着,,,,,这个赛道正在以极高的溢价抢夺人才和数据。。。。。接下来的竞争,,,,,将不再是谁先宣布模子,,,,,而是谁能真正解决数据从那里来、模子怎样在差别场景低本钱迁徙、这些更详细也更艰难的问题。。。。。
总而言之,,,,,现在具身智能正在履历一个从炫技到干活的艰难转身。。。。。已往两年,,,,,行业的兴奋点集中在"能不可做出来",,,,,接下来的五年,,,,,真正的磨练是"能不可用起来"。。。。。
而资源正在用真金白银投票给大脑而不是身体,,,,,这自己已经说明行业对瓶颈在那里的整体判断。。。。。这条路的终点还远未可见,,,,,但偏向已经清晰,,,,,接下来的问题,,,,,只是谁先走通。。。。。