前段时间,,雷科技 WAIC2026 报道团亲赴现场,,近距离视察了这场全球 AI 大展,,也看到了一场规??涨暗娜诵位等顺扇死。。。
凌驾 200 家机械人相关企业、300 多台真机同台竞技——从宇树三米高的载人变形机甲往返切换形态,,到智元的机械人用镊子夹起 2 毫米电阻焊到电路板上。。。已往最容易围住观众的后空翻和机械舞还在,,但厂商越来越想证实另一件事:
机械人不但会动,,还醒目活,,甚至干更多活。。。
但造出一副能跑、能跳、能伸手的「身体」,,已经不是当下最稀缺的能力。。。真正的瓶颈是「大脑」,,是怎么让机械人看懂杂乱的情形,,决议下一步做什么,,再把决议稳固地送到几十个枢纽。。。
就在 WAIC 竣事一周多后,,Google DeepMind 推出了 Gemini Robotics 2,,一个主打「全身智能」的机械人通用模子,,适用于州差别形态的机械人。。。
但最主要的要害词照旧「全身智能」。。。人类弯腰捡起地上的水壶,,会自然地前倾、屈膝、伸手,,同时调解重心。。。封一只自封袋,,会自然地对齐两侧封口,,再用手指从一端捏到另一端,,还会凭证塑料的形变随时调解力度。。。唬;等巳匆涣愣砸淮嗷デV频男卸。。。
图片泉源:Google Deepmind
身体零件越齐全,,控制难度反而越像滚雪球。。。
而谷歌这次的宣布包括三个模子。。。Gemini Robotics ER 2 认真明确情形、妄想长使命和与人相同,,Gemini Robotics 2 这个 VLA 模子把视觉与语言直接转成行动,,On-Device 2 则把行动模子压到外地,,并能用少于 200 个样例、几小时数据适配新的机械人本体。。。
但焦点在于,,谷歌最先用一组模子协调一台人形机械人的双腿、躯干、双臂和手指,,让它一边思索推理,,一边移动操作。。。
机械人终于不必“先站好、再伸手”了
已往不少机械人演示,,都有一种很强的回合制游戏感。。。唬;等讼茸叩阶辣摺⑼O隆⒄疚,,然后挪用机械臂抓取物体。。。抓完以后,,它再次切换到行走控制器,,去往下一个位置。。。每一段行动都可以做得很悦目,,但只要桌子偏了一点、物体滑了一下,,或者它必需边走边维持抓握,,几个自力??榈慕臃炀突崧冻隼。。。
上一代 Gemini Robotics 也主要控制机械人的上半身,,处理桌面使命。。。到了 Gemini Robotics 2,,官方视频中的 Apptronik Apollo 2 会走向放在地上的绿色水壶,,弯腰把它提起来。。。另一段画面中,,Apollo 2 走到货架前,,取出一只棒球手套,,随后转身脱离。。。
图片泉源:Google Deepmind
这些行动看起来平平无奇,,背后却同时依赖视野、可达规模、步态和重心。。。手臂伸得更远,,身体就要随着前倾。。。身体前倾,,双腿又必需实时赔偿。。。
视频也特殊标注,,画面中的机械人均为自主运行,,行动按真实速率播放。。。
这也是「全身」的现实寄义:模子不再把腿当运输工具、把手看成业工具,,而是把整副身体视为一个相互耦合的行动空间。。。谷歌称,,统一个模子已经用于搭载差别灵巧手的 Apollo 2,,以及使用两指夹爪的 Franka Duo。。。至少在手艺偏向上,,它想做的不但是一颗适配某款人形机械人的专用大脑。。。
虽然,,演示也没有快到让人爆发错觉。。。Apollo 走路、下蹲和摆放物体的速率都很慢,,谷歌自己也认可移动速率仍需提高。。。官方测试中,,Apollo 从桌面、地面和货架取物的平均乐成率划分为 68.4%、45.7% 和 76.3%。。。最能体现全身控制的地面取物,,恰恰也是乐成率最低的一项。。。
偏向是对的,,只是行动还不敷利索。。。
从拧灯胆到扎垃圾,,机械人难在「最后几厘米」
全身控制解决的是机械人怎么抵达、怎么站稳。。。真正决议它能不可进入家庭和工厂的,,往往照旧最后几厘米。。。
在官方视频里,,Apollo 2 使用一只拥有 22 个自由度的五指 SharpaWave 灵巧手,,实验拧灯胆、封自封袋、给垃圾袋打结。。。另一边,,Franka Duo 的两只夹爪认真把形状各异的工具细密装进工具箱。。。
图片泉源:Google Deepmind
已往机械人最常见的抓取演示,,往往只是把一个硬物从 A 点搬到 B 点。。。这些使命却涉及一毗邻触、双手配合和形变:塑料袋会塌,,绳结会滑,,灯胆既要瞄准螺纹,,又不可捏得太用力。。。
人类做这些事时,,不会先想好 22 个枢纽各自旋转几多度。。。Gemini Robotics 2 要做的,,正是从视觉和指令直接天生这些高频、一连的行动。。。
不过谷歌宣布的效果也很实诚。。。两指夹爪在通用抓放、工具配套和细密插入上的平均乐成率抵达 74.2%、78.9% 和 89.6%,,到了多指灵巧手,,差别迅速拉开:拧下灯胆抵达 92%,,拧上灯胆只有 36%,,扎垃圾袋是 44%,,使用簸箕和封自封袋划分只有 32% 和 40%。。。
这组数字也说明晰大模子已经能接受相当重大的手部行动,,而多指灵巧操作远没有抵达官方模子页面所说的「人类级」。。。至少现在,,机械人拧灯胆仍然可能十次失败六次。。。
图片泉源:Google Deepmind
第三个转变是协作。。。视频中,,Apollo 与 Franka Duo 配合整理工具箱。。。Apollo 发出使命,,Duo 把工具装入盒内,,两台机械人各自运行一套模子,,通过高层推理分配和衔接事情,,而不是由一其中央神经网络同时使用两副身体。。。ER 2 还会一连审查视频,,判断使命进度、发明失败并决议是否重试。。。
这和两台机械人机械地执行预设工序不太一样。。。谷歌想让差别形态的机械人先明确相互善于什么,,再像团队一样交接使命。。。只是官方视频展示的是一个经由设计、总长几分钟的工具收纳场景,,离多台机械人在真实工厂里一连协作几个月,,还隔着很长的稳固性验证。。。
谷歌没有扬弃「巨细脑」,,只是拆掉身体的界线
具身智能行业现在普遍将机械人架构概括成「大脑」和「小脑」。。。大模子认真看懂指令、拆解使命,,小模子和古板控制器认真导航、平衡、抓取。。。这样做很务实:高层推理不需要每秒运行数百次,,底层控制也不可等一个大模子逐步思索。。。??橥牙,,安排、调试和清静兜底都更容易。。。
问题在于,,物理天下并不喜欢整齐的??榻缦。。。
抬起一个重物会改变平衡,,向前迈步会改变手臂的可达规模,,手里的杯子一滑,,原来的路径妄想马上作废。。。高层妄想与底层行动只要明确纷歧致,,过失就会在长使命中累积。。。每次从行走切换到抓取、从抓取切回导航,,也可能带来停留。。。唬;等讼宰磐攵粤,,身体却没有照做。。。
但严酷来说,,谷歌并没有放弃「巨细脑」。。。ER 2 依然是高层大脑,,认真看、想、妄想和挪用工具,,再把行动执行交给 VLA。。。它甚至可以把导航 API、机械臂接口和其他厂商的 VLA 当成工具。。。
谷歌解决的,,是在行动层继续把走路、平衡、躯干和手臂切成一堆互不相关的小脑。。。Gemini Robotics 2 用一个 VLA 统一全身行动,,ER 2 则可以一边视察执行,,一边思索后续方法,,镌汰机械人每做一步都要「停下来想想」的割裂感。。。
图片泉源:Google Deepmind
这是一条更准确的分界线:高层仍然分层,,身体最先端到端。。。
这也诠释了谷歌为什么没有把所有环节都塞进一个巨型网络。。。唬;等说撞憧刂谱非蠛撩爰断煊,,高层推理却可能要检索资料、明确人类迷糊的要求。。。两者需要的算力、数据和运行频率都差别。。。所有揉在一起,,训练本钱会迅速上升,,出了问题也很难判断事实是妄想错了,,照旧枢纽没有执行到位。。。
更现实的是清静。。。模子可以决议把水壶放到货架,,急停、限速和人与机械人的清静距离却不可只靠概率包管。。。ER 2 引入清静约束、可行性判断和请求人类介入,,底层仍保存古板物理清静机制,,说明谷歌也没有妄想让端到端学习包办一切。。。
并且这条蹊径也不是谷歌独吞。。。Figure 在今年头宣布的 Helix 02,,同样把所有传感器接入一个全身视觉运动战略,,让 System 1 以 200Hz 输出全身枢纽目的,,再由 System 0 以 1kHz 处理平衡和接触,,最上层的 System 2 继续认真语义推理。。??雌鹄聪褚桓瞿W,,内部仍是按差别时间标准细密咬合的三层系统。。。
智元最新的 GO-2 也直接把问题称为「语义—执行鸿沟」,,用行动头脑链与异步双辖档同接低频妄想和高频执行。。。各人并没有简朴地在「一个模子」和「巨细脑」之间二选一,,而是在缩短??橹浯暗木嗬。。。
全身智能,,要经得起生涯场景的「拷打」
现在具身智能模子的前沿探索,,大致都在追三件事:更多本体、更长使命和更少的专用数据。。。英伟达开源的 GR00T N1.6 吃进了数千小时遥操作数据,,已经在智元 Genie-1、宇树 G1 和差别双臂平台上举行后训练,,并把全身移动操作纳入数据集。。。
Physical Intelligence 的 π0.5 则混淆差别机械人、网页知识和高层子使命数据,,让轮式双臂机械人在生疏住宅里一连整理厨房和卧室,,使命时长抵达 10 到 15 分钟。。。而蚂蚁灵波开源 LingBot-VLA 2.0,,用 6 万小时数据笼罩 20 种机械人构型,,还把手臂、灵巧手、腰、头和移动底盘映射进统一行动空间。。。
这些都越来越像大语言模子早期的竞争:先用多使命、多本体数据训练一套基础能力,,再花少量数据适配详细硬件和场景。。。Gemini Robotics On-Device 2 用不到 200 个样例适配新本体,,最值得关注的也在这里。。。若是换一副机械臂、换一套传感器都要重新收罗海量数据,,所谓通用模子就很难形陋习模效应。。。
但机械人比谈天模子更难瞎搅。。。英伟达在 GR00T N1.6 的说明中仍认可,,多使命语言追随和漫衍外泛化是一连挑战。。。谷歌的五指使命乐成率也清晰批注,,统一个模子能控制差别身体,,不即是它已经稳固掌握所有身体。。。更别说真实安排还要面临磨损、电量、碰撞、人类突然突入和网络中止。。。
以是,,Gemini Robotics 2 最主要的地方,,不是给机械人装上了一颗突然开窍的大脑,,是在于让具身智能模子最先越过桌面和上半身,,把走路、平衡、细腻操作、长使命与多机协作放进统一张考卷。。。相较之下,,之前一种使命对应一组算法的做法,,更靠近前大模子时代的 AI。。。
与此同时,,WAIC 上那些越来越成熟的芯片、枢纽和整机,,已经为 AI 准备了许多副身体。。。谷歌这次试图证实,,模子也最先学会把身体看成一个整体来使用。。。至于它什么时间能真正走进凯时AG的厨房,,弯腰捡起掉在地上的杯子,,随手擦干洒出的水,,再在我们回家前把房间料理好——那不但需要全身智能。。。
最后值得一提的是,,8月19日到23日,,2026天下机械人大会(WRC)将在北京举行,,主题是“人机共生,,产需共融”,,从官网的新闻来看,,本次参展企业300余家,,比去年多了36%,,其中展品超2000件,,首发新品突破150件,,同时,,来自20多个国家的1万多名赛手也将加入机械人大赛总决赛。。。雷科技也将派出WRC报道团赴北京举行全程现场报道,,通过深度图文和探展视频,,给各人带来最新鲜、专业和周全的一线视察,,敬请关注!
7月31日,,主题为“与AI同游”的ChinaJoy2026重磅启幕。。。腾讯、网易、索尼、高通、迈从、逍遥等共计 900 家泛娱乐展商,,携手泛起全球娱乐业饕餮盛宴;;;AI加持下,,终端、外设、机械人、显示、芯片等硬科技品牌,,怎样与游戏内容业跨界泛起娱乐新体验??由首创人兼总编辑罗超领衔,,雷科技 ChinaJoy 2026 报道团,,即将空降上海滩重磅泛起,,敬请关注。。。