作为具身智能最主流的蹊径之一,,VLA 快速生长的同时也由于其种种问题被诟病。。。。。其中最主要的痛点之一即是指令泛化能力。。。。。
大部分论文展示的能力都在训练和测试集指令漫衍一致的数据上刷点,,效果哪怕是像 LIBERO 这种现在看起来简朴的数据,,在简朴改写指令后性能都会暴降。。。。。如下图所示,,vla-adapter 在 LIBERO-para 上性能暴降 51%。。。。。关于具身 AGI 来说,,这是一个不可接受的问题,,我们期待的是一个在种种情形下能听懂人的种种表述形式的使命指令的机械人。。。。。
因此,,VLA 真正难的,,并不是在牢靠指令模板上再多拿几个点,,而是让统一个使命在差别说法下,,最终落到统一套机械人行动上。。。。。也就是目的物体没有转变、视觉场景没有转变、乐成条件也没有转变,,只是换了一种语言表达,,机械人仍然应该完成原来的使命。。。。。
围绕 VLA 语言泛化的问题,,来自上海交大和无界动力具身智能实验室的联合团队提出了一项极其简朴但很是有用的解法。。。。。通过重新设计语言语义进入视觉与行动盘算路径的方式,,让模子不依赖大宗 paraphrase 训练,,也能更稳固地执行改写后的指令。。。。。
论文问题: Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models论文地点:https://arxiv.org/abs/2608.02497GitHub地点: https://github.com/AutoLab-SAI-SJTU/GSR-ParaVLA
指令只改几个词,,VLA 的行动就可能完全差别
目今不少 VLA 事情都在 LIBERO、RoboTwin 等 benchmark 上一直刷新乐成率。。。。。但标准 benchmark 中的语言通常较为牢靠,,模子在训练和测试阶段看到的指令表达高度相似。。。。。
这会掩饰一个基础问题:模子事实明确了 Instruction 所表达的使命寄义,,照旧只把某种牢靠说法当成了 0,,1,,2 这样的使命标签?????
例如:抓取较大的红色物体;;;;改写为:拿起尺寸更大的红色方块。。。。。对人类而言,,两句话对应的是统一个使命。。。。。但对 VLA 来说,,这种看似细小的转变,,可能让原本能够稳固完成的使命直接失败。。。。。
本文首先在 LIBERO-Para 上评估了 VLA-Adapter、SmolVLA 和 π0.5 三个模子。。。。。LIBERO-Para 是在 LIBERO-Goal 使命基础上构建的语言泛化 benchmark。。。。。它坚持机械人面临的场景、物体、初始状态和乐成标准稳固,,只改写使命指令中的行动表达、物体形貌,,或同时改写两者,,用来测试模子在使命没变、只是换了一种等价表述的情形下能否继续准确执行使命。。。。。
换个表述,,VLA性能就会掉这么多
效果显示,,SmolVLA 在原始指令上的乐成率为 72.0%,,面临改写指令时却只剩 4.47%;;;;VLA-Adapter 从 98.2% 降至 46.82%。。。。。即即是经由大规模异构数据训练的 π0.5,,也仍然保存语言改写带来的性能损失。。。。。
换句话说,,在标准指令上取得高乐成率,,并不即是模子具备稳固的 Instruction 追随能力。。。。。
但乐成率下降只能说明问题保存,,并不可诠释问题出在那里。。。。。
关于后训练微调来说,,常见的解法是是继续网络更多等价表述,,将改写语句加入训练。。。。。关于预训练来说,,像 pi 一样经由大规模的数据训练,,模子见多了语言使命形式,,也能增强指令泛化的能力。。。。。但这个论文发明,,或许尚有一种更简朴的解法。。。。。本文从模子结构中「L」的设计角度思量重新思索这个问题。。。。。
剖析 1:失劣行动里,,仍然保存着准确使命的结构
为了判断使命信息是否已经消逝,,论文首先设计了一个行动级检索实验。。。。。
关于统一个视觉 Observation,,模子先吸收目今使命的改写指令,,天生一个 action chunk。。。。。随后,,在完全相同的视觉输入下,,再划分输入十个 LIBERO-Goal 使命的原始指令,,获得十组候选行动。。。。。
接下来只需要判断:改写指令天生的行动,,最靠近准确使命的原始行动,,照旧更靠近其他过失使命?????若是模子已经完全误解了指令,,那么改写指令爆发的行动不应该稳固地指向准确使命。。。。。相反,,若是其中仍然包括使命相关信息,,它就应该比过失使命更靠近对应的原始行动。。。。。
三个模子的 Retrieval@1 均显著高于随机水平 (0.1),,Semantic Retention 也所有为正。。。。。π0.5 的改写行动尤其显着地靠近准确使命;;;;VLA-Adapter 和 SmolVLA 虽然最终乐成率下降较大,,但其行动中仍然保存了一定的使命区分结构。。。。。
这组效果并不料味着每一个失败 episode 中,,模子都已经完整明确了指令。。。。。但它至少说明,,语言改写并没有让准确使命信息彻底消逝。。。。。
使命相关信息仍然保存,,问题更可能爆发在这些信息被转换为一连行动的历程中。。。。。
剖析 2:逐层替换:语言偏移怎样酿成行动偏移
上面的实验只能说明使命结构仍然保存。。。。。为了进一步判断内部语言特征是否真正控制行动,,论文对模子举行了逐层特征干预。。。。。
以 VLA-Adapter 为例,,统一个 episode 划分使用原始指令和改写指令运行,,两次运行中的视觉输入、机械人状态、初始情形以及行动天生条件所有坚持一致。。。。。在改写指令进入最后一个 Bridge-Attention block 前,,实验不改变 image token,,也不改变 state token,,只将该位置吸收到的语言特征替换为原始指令对应的语言特征。。。。。
效果显示:
展望行动之间的差别恢复了96.8%;;;;配对闭环乐成率从60% 提升至 96%。。。。。
替换详细层带来的恢复效果热力争
这说明,,改写指令并没有让模子进入一个完全无关的状态。。。。。更靠近现真相形的是:原始指令和改写指令之间爆发了一定的语言体现偏移,,而下游 Action Expert 对这种偏移很是敏感,,最终将较小的特征差别放大成了差别的机械人行动。。。。。为了确认这一位置确实加入使命控制,,论文还举行了 wrong-task intervention:将语言特征替换成另一个过失使命的特征后,,模子天生的行动会向被注入的过失使命偏移。。。。。
不过,,这并不是所有 VLA 的配合特征。。。。。
在 VLA-Adapter 中,,最后一个 Bridge-Attention block 的单层替换就能恢复 96.8% 的行动差别;;;;而在 SmolVLA 和 π0.5 中,,对恣意单层举行相同替换,,最高只能划分恢复约 10.5% 和 31.3%。。。。。
这说明三类架构处理使命语义的方式并不相同:VLA-Adapter 将语言信息送入相对自力的 Bridge-Attention policy,,控制位置较为集中;;;;SmolVLA 和 π0.5 则在多层多模态盘算中一连融合语言、视觉和状态,,使命信息越发疏散。。。。。
因此,,语言泛化问题不可简朴概括为「所有 VLA 的 Action Head 都在某一层失效」。。。。。差别架构的信息流差别,,语义修复的位置也需要随之转变。。。。。
剖析 3:两项控制实验:动态图像与语言都会扰动语言体现
在确认语言特征差别会影响行动后,,论文继续追踪这些差别是怎样爆发的。。。。。剖析主要围绕 VLA-Adapter 的辅助 Qwen 分支睁开。。。。。该分支同时吸收目今图像和使命指令,,因此语言 token 并不是由文本单独编码获得,,而是在视觉 — 语言联合建模历程中爆发。。。。。
第一项实验用于隔离动态视觉输入对语言体现的影响。。。。。模子举行两次前向。。。。。第一次前向中,,Qwen 吸收真实图像和使命指令;;;;第二次前向中,,Qwen 吸收相同指令,,但图像被替换为一张牢靠图像。。。。。随后,,第二次前向爆发的语言 token 被送回第一次前向的盘算路径,,而机械人的主视觉分支仍然使用真实 Observation。。。。。
也就是说,,机械人依旧能够看到目今场景,,只是不再让使命语言体现随着辅助 Qwen 分支中的动态图像配合转变。。。。。
剖析3概述图
仅通过这一处理,,VLA-Adapter 在完整 LIBERO-Para 上的乐成率就从46.82% 提升至 61.58%。。。。。将 dummy image 换成牢靠的自然图像后,,也能视察到相同趋势。。。。。
这一效果说明,,在该结构中,,使命形貌与动态图像被配合编码时,,可能会引入特另外特征波动。。。。。关于机械人行动而言,,这些波动并不代表使命自己爆发了转变,,却仍然会改变后续控制效果。。。。。
剖析 4:移除「语言」偏向,,闭环乐成率从 55% 提升到 90%
第二项实验用于剖析原始指令和改写指令之间的语言差别。。。。。
论文接纳交织验证,,先使用八个使命预计 32 个能够区分原始指令和改写指令的特征偏向,,再将这些偏向从剩余两个未见使命的改写指令特征中移除。。。。。
移除后:
原始指令与改写指令之间的行动差别从0.4361 降至 0.2282;;;;20 个闭环 episode 上的乐成率从55% 提升至 90%;;;;移除相同数目、相同范数的随机偏向,,行动差别基本坚持稳固。。。。。
这说明,,等价指令纷歧定会让模子彻底遗忘使命,,但可能在特征空间中引入系统性的语言偏移。。。。。下游 Action Expert 没有学会忽略这些与使命无关的转变,,反而将它们映射成了差别的行动。。。。。
这也组成了 GSR 的直接念头:与其通过大宗改写数据一直笼罩差别说法,,不如先提供一个越发稳固的使命语义源,,再重新学习这部分语义怎样影响行动。。。。。
剖析4概述图
解法:GSR——重修语言到行动的信息流
基于前面的剖析,,论文提出Grounded Semantic Re-Binding,,简称 GSR。。。。。GSR 的基本历程可以分成三步。。。。。
首先,,使用冻结的 T5 编码器单独处理语言指令。。。。。T5 不吸收图像,,也不吸收机械人状态,,只认真提取使命自己的文本语义,,从源头上镌汰动态图像与语言转变带来的体现滋扰。。。。。
随后,,凭证差别 VLA 原本的多模态盘算方式,,将投影后的 T5 语义重新注入模子用于融合使命、视觉和状态信息的位置。。。。。注重,,像上文剖析所述,,差别模子的融合位置纷歧样,,因此注入的位置也纷歧样。。。。。
最后,,重新初始化并训练 Action Expert,,使其从训练最先就学习怎样使用新的语言条件,,而不是继续沿用已经适配旧语言路径的行动映射。。。。。
GSR整体架构
T5 提供「需要完成什么使命」,,目的物体的位置、目今机械人状态以及详细行动轨迹,,仍然由模子原有的视觉和状态路径决议。。。。。
因此,,GSR 处理的不是纯粹的文本编码问题,,而是语言语义怎样重新进入真实场景盘算,,并最终控制一连行动的问题。。。。。
效果:轻量模子指令泛化能力暴涨,,
经由大规;;;;等耸菰ぱ盗返母竽W右材芗绦竦迷鲆
所有 GSR 模子均只使用 LIBERO-Goal 中的原始指令训练,,没有特殊使用改写指令。。。。。
完整 LIBERO-Para 包括 4,092 个 episode,,其中包括 870 个行动表达改写、259 个物体形貌改写,,以及 2,963 个组合改写。。。。。
VLA-Adapter 的 Full Para 乐成率从 46.82% 提升至 70.94%,,增添 24.12 个百分点;;;;SmolVLA 从 4.47% 提升至 49.12%,,增添 44.65 个百分点。。。。。
π0.5 原本已经通过大规模异构数据获得了较强的语言泛化能力,,但 GSR 仍将其 Full Para 乐成率从 73.60% 推进到 75.59%,,并取得论文中报告的最高 PRIDE 分数 70.4。。。。。此项分数高于近期宣布的大规模预训练模子 Xiaomi-Robotics,,证实晰其进一步提升目今 VLA 模子指令泛化能力的潜力。。。。。
更主要的是,,简朴地在原生路径的 Action Expert 旁边增添一个 T5 并不可获得同样的效果。。。。。VLA-Adapter 的 Native + T5 只从 46.82% 提升至 47.31%;;;;SmolVLA 的对应版本也只有 13.49%。。。。。真正爆发提升的并不是「模子里多了一个语言编码器」,,而是原生语言路径、稳固语义源、视觉 grounding 和 Action Expert 之间的信息流被重新组织。。。。。
剖析:路径冲突:接入两个语言源后,,谁真正控制行动
论文还设计了一组 language-route authority 实验,,划分向原生语言路径和 T5 路径输入准确或过失使命。。。。。
C/C 体现两条路径都吸收准确指令;;;;W/C 体现原生路径吸收过失指令、T5 吸收准确指令;;;;C/W 则相反。。。。。
VLA-Adapter 在 C/C 下的乐成率为 47.31%。。。。。当原生 Qwen 路径吸收到过失使命时,,乐成率降至 5.11%;;;;而当 T5 吸收过失使命时,,乐成率仍为 44.0%。。。。。
这说明,,纵然 Qwen 对改写指令的泛化较差,,它仍然掌握着主要行动控制权。。。。。只在旁边加入一个更稳固的语言编码器,,并不可阻止原生路径继续主导机械人。。。。。SmolVLA 在两种冲突条件下都会严重下降,,说明两条语言路径之间保存显着滋扰。。。。。
π0.5 则主要依赖原生 PaliGemma,,且该路径自己已经较为可靠,,因此适合保存原生指令,,并将 T5 作为辅助。。。。。
这组效果诠释了为什么 GSR 必需接纳架构相关的设计:语言特征是否保存是一回事,,哪条路径真正拥有行动控制权是另一回事。。。。。
探索:ParaVLA:探索新 VLA 架构的可能性
在 GSR 之外,,论文还实验了一个越发彻底的实验性架构 ParaVLA。。。。。
ParaVLA 使用冻结的 T5 处理指令,,使用 DINOv2 处理视觉。。。。。语言与图像在前端坚持相对自力,,最终在 Action Expert 中与机械人状态和行动信息融合。。。。。
ParaVLA 与经典 VLA 架构的比照
在 LIBERO-Goal 的原始指令和改写指令上,,ParaVLA 划分取得了 92% 和 91% 的乐成率,,二者只相差 1 个百分点。。。。。
作为比照,,在相同结构中将 T5 替换为 SmolVLM decoder 后,,原始指令乐成率仍有 85%,,但改写指令乐成率下降至 41%(多模态基模不可提供稳固的语义)。。。。。这组实验进一步支持了论文的焦点视察:一个相对稳固、自力于目今视觉输入的语言条件,,有助于降低等价语言对行动天生的滋扰。。。。。
不过,,完全解耦也带来了新的问题。。。。。当视觉模子进一步扩大时,,ParaVLA 没有体现出古板 VLM 常见的 scaling 能力。。。。。因此,,本文未来事情会继续研究怎样同时保存稳固的使命语义、充分的场景 grounding,,以及大规模多模态模子的扩展能力。。。。。
结语:从增添语言数据,,到重新设计语言怎样控制行动
GSR 的重点,,不是证实数据扩增没有价值,,也不是简朴地用 T5 替换现有 VLM。。。。。
它关注的是一条更容易被忽略的链路:语言模子是否保存了使命信息,,这些信息在那里与视觉和状态交互,,以及它们最终通过哪条路径控制行动。。。。。
对 VLA 而言,,语言泛化失败可能并不总是意味着模子彻底没有明确指令。。。。。使命相关信息可能仍然保存,,只是在多模态融合和行动天生历程中,,等价表达之间的特征偏移被一直放大。。。。。
因此,,真正可靠的 VLA 需要解决的不但是模子规模和训练数据量,,还包括:语言语义从那里进入模子;;;;它在什么阶段与视觉和机械人状态连系:多条语言路径爆发冲突时,,哪条路径拥有控制权;;;;以及 Action Expert 能否对语义等价、外貌差别的语言体现坚持稳固。。。。。