WAIC最狠展台打爆工业「深水区」!它石智航首发具身原生大脑AWE 3.5,,,,具身Scaling周全释放
Jay 发自 凹非寺量子位 | 公众号 QbitAI
走进一家大型汽车制造商的线束车间,,,,你会看到和整车工厂截然差别的画面。。。
整车车间清洁、明亮、险些完全自动化。。。线束车间密密麻麻,,,,弥漫着汗味。。。
许多工人培训一个月,,,,在岗坚持不到三个月就脱离了。。。
这是工业自动化界公认的「深水区」。。。
△图为AI天生
现在,,,,被具身智能彻底打爆了。。。
2026年WAIC,,,,它石智航把一条1:1还原的环形线束流水线,,,,搬进了展馆。。。多台机械人集群相助,,,,流水线轮转线束板,,,,每个工位统一时间装配差别的线束线型。。。
效率自然大幅提升。。。它石智航首席科学西崽文超甚至奚落道:
现场我们都不敢让它一直干活,,,,怕机械人干太快给料用完了。。。
撑起这条全自动化产线的,,,,是它石智航刚刚宣布的具身原生基座模子AWE 3.5。。。
这也是具身智能领域第一个真正买通预训练到后训练完整范式的原生模子。。。
一台机械人的「多使命实战」
它石给新版本取名3.5,,,,信号也挺明确的:希望它像GPT-3.5一样,,,,在多使命能力上最先展现新的可能。。。
回看AWE的生长趋势,,,,也确实是这样。。。
3.0首秀,,,,它石打爆了线束场景。。。
到了3.5,,,,模子最先向更多场景溢出。。。工业装配、插接、收纳……所有被放进统一个模子里。。。
今年它石WAIC展台的主题-打造可信任的物理AI,,,,也是围绕这项特点睁开,,,,使命之间不重新加载新的模子,,,,不切换参数,,,,全靠统一个基础模子。。。
现场的展示很是魔幻,,,,他们的机械人简直是「劳模」,,,,整理桌面、打包手机、插网线、零件分拣……横竖不管啥工具,,,,递已往就开干。。。
用丁文超的话说就是:
跟主播带货一样(笑)。。。
但,,,,这只是开胃菜。。。
2026年是天下模子百家争鸣的元年,,,,不过,,,,事实什么是天下模子??????
在大部分人的认知里,,,,它照旧论文里的架构图和评测表格里的数字。。。
这次,,,,它石智航在WAIC给出了最直接的谜底:
你上手试一试。。。
现场观众戴上数据收罗夹爪,,,,就能和一个由AWE 3.5天生的平行天下睁开互动。。。
你捏起一块积木,,,,松手,,,,积木像受重力一样落向桌面。。。你拖拽手机盒,,,,盒子爆发对应的位移和摩擦。。。蜡烛上微弱的火焰,,,,也在模子中被忠实地泛起出来。。。
这些交互没有一行牛顿定律代码,,,,没有碰撞引擎,,,,没有物理结算。。。所有重力、柔性、碰撞反馈、物体位移……所有,,,,由模子从真实类数据中学到。。。
而在这个涌现之外,,,,有一项被严重低估的能力:长时影象与空间明确。。。
视频模子有一个难以治愈的缺陷——
展望未来的时间一长,,,,物体就容易突然消逝、变形,,,,或者在一帧幻觉之后彻底蒸发。。。
究其基础,,,,像素监视自己不勉励长程物理交互的一连性,,,,无法用于具身训练。。。
为此,,,,AWE 3.5依托human-centric数据专门强化了模子结构,,,,让它显式学习长时影象和长时序空间明确,,,,在数分钟的一连、交互闭环推演中坚持情形稳固。。。在此基础上,,,,后训练可以从一连历程中切出多个行动片断,,,,而不必担心情形在下一秒崩掉。。。
在天下模子中做强化学习,,,,成为了可能。。。
原生模子,,,,从第一性原理重构具身大脑
今年以来,,,,行业一直有VLA or 天下模子的争议,,,,但最近和许多做具身的朋侪聊了后发明,,,,真正训模子的人基础不在乎所谓蹊径之争。。。
无论哪条蹊径,,,,最终,,,,照旧要看是否能优化Action。。。
VLA架构里,,,,视觉和语言在预训练阶段就细密耦合,,,,行动模态却要到后训练才通过SFT接入。。。这相当于一个学生先学了所有理论课,,,,临考试前才最先下手做实验。。。理论和实操之间,,,,隔着一道先天的裂痕。。。
天下模子蹊径往前走了一步,,,,至少可以使用大规模视频学习表征能力。。。但互联网视频模子的Attention结构已经在几十万到百万小时的猫狗视频上定型了,,,,直接往具身基座模子里嵌,,,,容易走向两个极端:
1、视频模子原有的幻觉跑举行动战略,,,,导致操作不到位或判断杂乱;;;;
2、视觉明确、空间明确和行动永远无法同步。。。
因此,,,,早在行业掀起「天下模子」热浪前,,,,它石从第一天便毅然选择了另起炉灶——
重新训一个原生的具身模子。。。
详细而言,,,,AWE 3.5从预训练阶段最先,,,,就把视觉、语言、行动等多种模态一起喂给模子。。。统一套架构,,,,既能输出行动,,,,也能展望未来。。。
丁文超把它称为One Model结构。。。
这个架构设计有一个精妙之处:模子自己稳固,,,,只改变输入输出的组合方式,,,,就能切换出完全差别的「人格」。。。
视觉到行动,,,,是Base Policy,,,,认真制订战略、发出指令;;;;以行动为条件展望未来视觉,,,,是Action Condition World Model,,,,认真展望情形转变。。。两者交互在一起,,,,就是一套完整的强化学习闭环。。。
打个例如:打包书包时拉拉链。。。
这是一个毫米级精度的活,,,,并且随处是「卡点」。。。拉多一点可能乐成,,,,拉少一点可能抓不住,,,,用力过猛可能卡住。。。
古板的做法是把机械人放在真机上一遍遍试,,,,失败一次就纪录一次,,,,数据贵、速率慢、装备磨损还大。。。
AWE 3.5的做法是:先在预训练模子的「脑海」里模拟。。。模子想象拉链在差别力度下的种种效果,,,,然后把最优战略告诉Base Policy。。。这比在真机上重复试错快了不止一个数目级。。。
这就是它石原生模子最焦点的突破:模子成了自己的「仿真器」,,,,而无需手工搭建仿真情形。。。预训练建设通用物理交互能力,,,,后训练在模子内部的天下里自我对弈、自我强化,,,,形成自闭环。。。
这套范式,,,,是语言模子在文本事域已履历证过的路径;;;;但在具身原生模子里,,,,它石开发的AWE 3.5是第一家完整跑通的。。。
而之以是能成,,,,也是它石恒久结构之下两条暗线的交汇所赐——
足够大的真实数据规模,,,,以及能消化大规模数据的Infra。。。
缺任何一样,,,,这个闭环就转不起来。。。
先看数据量——
AWE 3.5,,,,基于超百万小时human-centric数据训练。。。
这个量级有多夸张??????
这么说吧,,,,现在市面上大大都视频天生模子,,,,训练数据是在百万小时级别。。。
自动驾驶所需数据,,,,也是这个量级。。。
但百万小时,,,,不是简朴的堆量游戏。。。
具身数据的价值漫衍极不匀称。。。部分数据对模子至关主要,,,,但重复度高、交互简单的数据,,,,对模子险些没用。。。
怎样从百万小时中筛出真正高质量的部分,,,,已经成为比收罗自己更紧迫的问题。。。
这对数据Infra提出了极高的要求,,,,也是它石这几个月以来重点优化的偏向。。。
它石数据系统的重心,,,,正在从「更多」转向「更智慧、质量更高」,,,,Data Efficiency正在成为新的评测维度。。。
而当数据规模和数据效率同步上去后,,,,Scaling的威力也终于获得了印证。。。
丁文超体现,,,,现在预训练已经足够扎实,,,,一个新使命只需要小时级别的数据收罗就能跑通。。。
这正是当初它石选择One Model架构的前瞻性:先建设通用基础能力,,,,再向各个场景分发。。。
现在随着AWE 3.5宣布,,,,这项前置战略的盈利也终于最先展现——
它石等的,,,,历来不是线束这一个场景的闭环。。。
量子位获悉,,,,除线束之外,,,,柔性操作、分拣、检测协同……等多个工业场景,,,,也已经在验证中。。。
基于此,,,,丁文超给出了一个大胆判断:
具身Scaling已周全释放。。。2027年上半年到年中,,,,可能泛起分水岭。。。
行业已经从「机械人文娱舞蹈」,,,,进入「机械人真干活」的阶段。。。
展会热度,,,,则是一个先行指标。。。今年的WAIC,,,,具身智能企业凌驾200家,,,,机械人展区的人流显着凌驾其他区域。。。
而它石的展区,,,,同样也是堆满了人。。。
「机械人事实什么时间进厂干活??????」——这个问题,,,,无论线下照旧线上,,,,都已经很少再被人提起。。。
原因很简朴:各大头部厂商早已争相把机械人送进了工厂的深水区,,,,让它在真真相形中摔打、学习、迭代。。。
WAIC世博展馆一楼,,,,从北门进入,,,,映入眼帘的即是「模顿时代·同伴之城」。。。一个机械人各司其职、笃志干活的实景展区。。。
而进门右侧第一个展位,,,,它石带来的汽车细密线束装配演示,,,,无疑是其中最为奇异的一个。。。
我亲手体验了一番:插孔极小,,,,必需眯起眼睛才华委屈瞄准,,,,即便插了进去,,,,也很可能是误插,,,,必需要插到准确点位才华使用。。。人工操作尚且云云,,,,对机械人而言,,,,难度可想而知。。。
这是它石首次亮相WAIC,,,,也是我第一次在线下近距离寓目他们的Demo。。。但说真话,,,,这或许就是WAIC这类线下活动的意义吧,,,,看完之后,,,,脑海中原本模糊的印象一下子变得具象起来——
这不但是一家手艺过硬的公司,,,,更是一家特点鲜明、场景定位极其清晰的具身智能企业。。。
这也是丁文超在与量子位对话中,,,,重复强调的看法:
具身智能的下一步,,,,是让系统获得梯度,,,,也就是明确的迭代偏向。。。而这个偏向,,,,不可能仅靠公司内部的几个Demo来牵引,,,,它必需来自真实场景的正反馈。。。
它石正在做这件事。。。
对话它石首席科学西崽文超
具身Scaling能力释放
量子位:从AWE 3.0到3.5,,,,研发历程中有哪些难题凌驾了最初预期??????
丁文超:整体框架基本切合之前设定的节奏,,,,但有两点与最初的判断保存误差。。。
第一点是硬件与软件协同设计(Co-Design)的主要性远超预期。。。我们在AWE 3.0阶段已经意识到这个问题,,,,到了3.5及后续版本,,,,灵巧手的要害作用愈发凸显。。。
夹爪能解决约莫80%的问题,,,,但剩下20%若是所有依赖特制夹爪,,,,工程难度极高。。。目今灵巧手正在走向成熟——它能否真正胜任现实使命并跑通商业闭环,,,,很可能成为具身智能领域的一个主要里程碑。。。
做好灵巧手,,,,需要数据、模子和硬件三者兼备,,,,因此它也是磨练一家具身智能公司综合实力的「黄金测试」。。。我们在实践中逐步加深了敌手的主要性的认知。。。
从AWE 3.0之前最先,,,,我们就一连投入自研灵巧手。。。市面上许多产品接纳Bottom-Up的思绪——先追求高自由度,,,,再从硬件出发。。。凯时AG路径更靠近Top-Down:先梳理需要完成哪些人类行动、匹配哪些人类数据,,,,再反向界说硬件设计。。。这是一项妄想之外、但在历程中一直加大的投入。。。
第二点是具身智能的Scaling已经解锁。。。若是行业继续朝这个偏向群集资源,,,,头部效应会越开展现。。。
量子位:它石的human-centric数据已经抵达百万小时,,,,能否讲讲它石具身数据的Scaling曲线长什么样??????
丁文超:我们在具身领域对Scaling的界说是:通过合理的预训练与后训练范式,,,,将完成新使命所需的数据量和收罗本钱降到最低。。。
现在,,,,一个新使命普遍只需要小时级别的数据收罗,,,,就能让模子将使命完成到大致可用的水平。。。这条界线,,,,我们已经触遇到了。。。
量子位:要实现物理AGI,,,,数据还需要增添到什么规模??????
丁文超:这会逐渐演变为一个长尾问题。。。当基础数据积累到一定规模后,,,,能够孝顺高价值增量的新场景会越来越少。。。
到了谁人阶段,,,,与其纠结数据总量,,,,不如回到一个更实质的问题:模子究竟要完成什么使命??????我们要采什么样的数据??????怎样以可控的本钱让机械人胜任尽可能多样的使命??????
两者有交集,,,,但在现实推进路径上保存显着差别。。。
量子位:落地闭环会反过来影响模子训练??????
丁文超:基础数据抵达一定规模后,,,,虽然可以继续堆量。。。但真正的难点在于让系统获得「梯度」——也就是明确的迭代偏向。。。这个偏向不可能靠公司内部几个Demo来一连牵引,,,,它必需来自尊量真实场景需求的正反馈。。。
所有乐成的AI都受到真实需求的驱动。。。语言模子早期有很是多的应用偏向,,,,但真正把模子能力推向极致的应用之一是AI Coding。。。虽然AI Coding是一个笔直应用,,,,但它倒逼模子公司建设起预训练、大规模数据闭环、Harness Engineering等一整套系统化能力,,,,因此提供了极强的正反馈。。。
其他应用同样保存,,,,只是规模相对更小。。。正是这些应用的牵引,,,,让行业对语言模子能否走向AGI有了更坚定的判断。。。闭环跑通之后,,,,手艺的先进性才有了清晰的权衡标准。。。
具身智能同样需要找到若干个类似AI Coding级别的应用。。。它的能力不会局限于这些场景,,,,但正反馈通路能让数据、模子和Infra形成一条稳固、可靠、可扩展的完整链路。。。
我们目今最看重的,,,,是在多个场景中形成Killer App闭环,,,,并抵达一定规模。。。至于未来数据还需要再增添几个零,,,,现阶段并没有那么主要。。。
具身Scaling时代,,,,怎样重新明确Research??????
量子位:过早进入详细场景,,,,会不会导致模子过拟合??????
丁文超:(笑)你看我们展台展示的使命,,,,有过拟合吗??????
过拟合通常意味着系统只能做好一件事。。。但若是能笼罩足够多的使命,,,,能力自然就会形成泛化。。。我们在展台上同时展示多种差别的使命,,,,自己就是在验证这一点。。。
量子位:具身公司既要一连做Research,,,,又要寻找落地闭环,,,,这两条蹊径会在内部文化上形成冲突吗??????
丁文超:这是任何高科技公司都要面临的挑战。。。追求通用手艺架构的领先,,,,与建设终端客户的反馈闭环,,,,在一定水平上保存张力,,,,但也有共通之处,,,,要害在于动态平衡。。。
早期做AI Coding的公司也曾履历过动。。。河行┳龅揭话刖头牌;;;;有些恒久死磕应用,,,,却忽视了通用模子底座的希望。。。两头都不可缺失。。。
具身领域确实尚有许多Research可做,,,,但古板意义上的学术研究时机正在逐步收窄。。。当工业界最先Scaling,,,,学术界的空间就不会像早期那么大。。。
现在学术前沿正在向双臂灵巧操作、高自由度灵巧手等偏向迁徙,,,,若是继续用单臂或双臂夹爪去完成通例使命,,,,学术新颖性会逐渐降低。。。
学术界虽然还可以揭晓新的VLA或World Action Model要领,,,,但随着数据规模的提升,,,,许多Trick虽然仍有资助,,,,却不再起决议性作用。。。
行业纪律通常是:学术界先释放信号,,,,工业界找到更实质的问题并举行Scaling,,,,随后该偏向的学术空间收窄,,,,研究者再去寻找新的前沿——现在灵巧手可能就是学术界新的栖息地。。。
因此,,,,我们需要重新界说具身领域的Research。。。当下真正难题的问题包括:数据怎样收罗、筛选清静衡??????预训练Infra和网络架构怎样设计??????后训练流程怎样稳固迭代??????以及规模一直扩大后怎样解决系统性工程问题??????
这些问题少少能被一篇Paper完整笼罩。。。部分论文可能只提供零星的启发,,,,企业需要用第一性原理把潜在路径排列出来,,,,再用大宗实验逐一验证。。。这是一种「大规模Research」,,,,只是它的形态已经差别于古板的学术研究。。。
学术界的数据量有限,,,,也缺少大规模的真机闭环,,,,因此前沿研究正在加速向工业侧转移。。。这就像自动驾驶端到端手艺泛起后引发的范式转移一样,,,,具身智能正在履历同样的历程。。。
量子位:找场景和做Research越来越耦合,,,,你们内部怎样分配注重力??????
丁文超:在我们内部,,,,没有「预研」这个岗位,,,,所有人统称为工程师。。。但各人做的事情并不重复,,,,并且许多挑战现在连可供参考的论文都没有。。。在行业快速爬坡的阶段,,,,研究与工程必需细密咬合。。。也许再过两年,,,,等手艺方案进一步收敛后,,,,研究和工程两类岗位才会显着脱离。。。
量子位:行业进入Scaling和Scaling Research阶段后,,,,新入局者尚有时机吗??????
丁文超:新公司必需找赴任别化的切入角度。。。在当下这个阶段,,,,只凭几篇World Action Model或VLA论文就想创业,,,,难度已经很是高了。。。有了大规模数据和Infra的支持后,,,,工业界对潜在手艺蹊径的探索广度,,,,甚至可能凌驾学术界。。。
这和自动驾驶的生长轨迹很是相似。。。2021到2022年前后,,,,许多自动驾驶公司完成了从Research Driven到Product Driven的转变,,,,真正建设起了数据规模和Infra,,,,随后才迎来了2023、2024年端到端手艺的周全爆发。。。
具身智能正在履历类似的历程:从局部的手艺亮点,,,,走向系统化的系统作战。。。新入局者需要寻找新的生态位,,,,例如:把自己定位为通用天下模子公司,,,,让具身智能只是其中一个子场景;;;;或者避开已经高度内卷的Tabletop(桌面级)使命,,,,直接选择全尺寸人形等偏向。。。
量子位:它石招人才最看重哪些特质??????
丁文超:若是只用一个词概括,,,,就是敢想敢做;;;;若是再加几个词,,,,那就是扎实靠谱。。。
在AI时代,,,,专业的界线已经大幅弱化,,,,个人脑子里装的知识很难凌驾大模子。。;;;;谡庖坏,,,,人不要给自己设限,,,,要敢于跨越界线去学习和行动。。。
永远不要低估模子
量子位:行业蹊径仍然疏散,,,,也还没有公司拿出类似GPT-3.5的决议性效果。。。应该用什么标准来判断具身智能公司??????它石智航的壁垒在那里??????
丁文超:早期判断的信噪比确实较量低,,,,但我展望2026年底到2027年可能会泛起分水岭。。。单场景使命各家公司只要起劲都能完成,,,,真正磨练基础模子能力的,,,,是以一定的可靠率完成多个使命。。。
2027年上半年到年中,,,,「能否实现多场景可靠落地」会成为要害的评判标准。。。若是一家企业能用AI化的要领实现多场景的规;;;;涞,,,,就会迅速与其他公司拉开差别。。。
现在投资人和通俗用户很难在线下直接接触机械人,,,,大多只能通过视频相识。。。但在未来12个月内,,,,机械人会真正进入更多公共可触达的场景。。。虽然进入家庭仍保存Gap,,,,但机械人将最先肩负更多真实的商业使命。。。
到那时,,,,评判标准会变得很是直观:机械人究竟完成了哪些事情??????扩展新使命的速率有多快??????本钱有多低??????这很是类似自动驾驶早期的生长轨迹——各家公司先圈定几条演示蹊径,,,,随后最先比拼「开城速率」,,,,最终进入存量竞争和大规模量产阶段。。。
量子位:今年WAIC上,,,,醒目活的机械人显着变多了。。。具身大脑现在生长到什么阶段了??????
丁文超:希望快的公司可能已经最先切入现实场景。。。
展会里展示的「干活」使命大多经由了笼统和简化。。。真正进入工厂后,,,,系统需要恒久、稳固、不中止地运行,,,,工程难度依然极高。。。
2024年,,,,各人看到机械人本体「能动」就以为很厉害;;;;厥后最先关注Pick and Place(抓取与放置)以及稍重大的操作;;;;而现在最焦点的拷问是:它有没有在真实场景中一连、稳固地事情。。。
量子位:进入工厂后,,,,除了手艺,,,,还需要具备哪些能力??????
丁文超:服务客户的精神。。。需要与生态企业深入交流:相识用户喜欢什么功效、交互逻辑怎样设计,,,,以及哪些需求源于真实现场,,,,哪些只是团队自己的「脑补」。。。这是手艺走向落地必需履历的祛魅历程。。。
量子位:具身智能保存实时安排和推理算力的约束。。。有些团队选择针对简单工厂训练小模子,,,,以兼顾清静性和实时性。。。你怎么看这种妥协??????
丁文超:大模子同样可以推得很快。。。系统处理大致包括两个环节:一是消化传感器信息并提取特征,,,,这部分较慢;;;;二是天生行动,,,,这部分着实没有那么慢。。。
许多系统显得缓慢,,,,是由于把感知处理与行动天生串行了起来。。。它们完全可以异步解耦运行:例如感知以几赫兹的低频更新,,,,而行动则以几十赫兹的高频输出。。。推理速率与模子巨细保存关联,,,,但不可直接划等号,,,,参数目很大的模子经由工程优化,,,,同样可以做到极速推理。。。
量子位:它石从第一天起就敌手艺架构想得很清晰,,,,岂非就没有什么让你感应疑心的问题吗??????
丁文超:我现在最大的「未解之谜」(Mystery)在灵巧手。。。
灵巧手会在最后增添约20个自由度,,,,两只手配合会特殊引入约42个自由度。。。
面临这样一个高维且富接触(Contact-rich)的重大系统,,,,会不会催生出新的手艺挑战,,,,甚至引发新的能力涌现??????这是我现在最体贴、也最兴奋的事情。。。
量子位:灵巧手距离进入真实场景尚有多远??????
丁文超:我们很是坚定地要把灵巧手带入真实场景,,,,绝不会把它局限在学术探索或实验室Demo中。。。现在很难给出准确的时间表,,,,但乐观预期是12到18个月内能看到显着的工业趋势。。。也许在凯时AGAWE后续版本中,,,,各人就能看到一些实质性希望。。。
量子位:Sergey Levine在CVPR分享中提出,,,,可以用机械人数据去扩展其他模态的数据,,,,似乎不再坚持纯粹机数据蹊径。。。你怎么看Physical Intelligence(π)的这种转变??????
丁文超:这是一个必定选择。。。已往π的蹊径主要依赖多场景的遥操作(Teleoperation)和高质量的真实机械人数据(Robot Data)来获取泛化能力,,,,但这依然受限于机械人本体的物理收罗效率。。。
我个人气概更倾向于提前想清晰整体架构。。。做一个系统就像建屋子,,,,最好先明确大致形态和须要的承重结构,,,,再以高执行力去施工。。。最终形态可以与预期有误差,,,,但绝不可做到一半才发明缺少要害的承重墙。。。
要真正走到各人期待的π1甚至更远的未来,,,,需要更多Top-Down(自顶向下)的全局设计头脑,,,,而不可仅仅依赖局部的拼图扩展。。。
量子位:从AWE 3.0到3.5,,,,你们做了不少前沿探索,,,,最想分享的Takeaway(焦点心得)是什么??????
丁文超:永远不要低估AI模子的能力。。。
人们经常在某个阶段突然失去信心,,,,从而退缩到某个过窄的笔直领域或特定的守旧要领中。。。
2023、2024年,,,,各人以为机械人连「动」都难题;;;;运动能力提升后,,,,又有人说它不可「干活」;;;;到了2025、2026年,,,,机械人醒目一些活了,,,,质疑又酿成了「它只能完成单步使命,,,,无法处理长序列」。。。未来还会有人说它无法完成所有事情。。。
质疑的「球门」在一直向后移动,,,,但行业现实已经前进了很远。。。
量子位:以是你以为Scaling可以解决一切??????
丁文超:是的。。。我们需要一连敬畏并重视Scaling带来的能力跃升。。。
@何美玲:买断游戏平台,,,,地动致绵竹街道衡宇受损??????谣言@钟成鸿:立总统忠言外长搞欠好对华关系就走人
@张振群:奶奶微信有77万条未读新闻