行为克隆告诉机器人“这个时刻手臂该怎么动”,却不直接说明这段动作要完成什么局部目标。浦项科技大学提出INDI,用教师视觉语言模型从执行视频中提炼行为意图,再监督VLA动作解码器。SimplerEnv-Bridge上,GR00T-N1.7平均成功率从64.3%升至84.7%。
真实双臂任务的提升更克制:平均成功率从62.0%升至68.7%,长程任务最高增加12.0个百分点。仿真数字和真实数字来自不同设置,不能混成一个“全面提升20点”的结论。
动作相同,服务的目的可能不同
抓起一个方块,下一步可能是放进抽屉、叠到另一个方块上,或跨箱搬运。单纯复现电机命令,会把不同目的下看起来相似的起始动作混在一起。未来帧监督能告诉模型会看到什么,却仍偏向一次具体执行结果。
论文Figure 1:行为克隆只监督动作,未来监督关注结果,INDI额外提取行为级局部目的。
INDI把“即将发生的行为要达到什么”编码成中间表示。它不要求部署时再调用教师模型,也不把自然语言解释直接拼到动作输出上。
教师看完整片段,学生只从当前输入恢复意图
训练时,冻结的教师VLM读取当前观测、指令、粗粒度动作摘要和对应执行视频,产出多模态意图表示。部署VLA仍只看正常输入,在动作解码器中间层恢复这个表示,并同时预测动作、行为展开方式和结果。
论文Figure 2:教师从执行片段提炼目的,VLA在中间层恢复意图并组织后续动作预测。
教师只用于训练,因而不会给在线控制增加一次大模型推理。代价转移到数据准备:每段示范需要可配对的视频、动作和指令,教师判断错误也会进入监督信号。
两组仿真基准和四项真实任务分别验证
SimplerEnv-Bridge中,INDI把GR00T-N1.7从64.3%提高到84.7%,增加20.4个百分点;RoboCasa Kitchen中,对照GR00T基线从64.1%提高到70.3%。论文也在π0.5上测试,两个基准均得到一致方向的增益。
84.7%是四类SimplerEnv任务的平均值,表中各任务分数并不相同。INDI对Pick Coke Can等任务提升明显,也有基线本来就较强的项目。平均数说明总体方向,不能据此认为每种操作都增加20.4点。
真实平台使用双臂SO-101,任务包括把环套到杆上、将小篮放进大篮、跨箱叠方块和把方块放进上层抽屉。每个任务需要多个连续步骤,机载观测来自头部和左右腕部三台相机。
论文真实实验设置:四项任务物体、初始状态与机器人相机视角。
论文真实回放:双臂机器人在篮筐整理等任务中的连续自主执行帧。
中间表示确实按任务和进度组织
作者对恢复出的潜在表示做检索和可视化。不同任务形成可分区域,同一任务的早、中、晚阶段也呈现连续变化;在保留片段中,正确意图多数能排到相近表示前列。这些分析支持动作解码器确实使用了意图信号,而不是训练时加了一个没有作用的辅助头。
真实实验还加入未见物体和干扰物,检查模型是否只记住训练道具。平均成功率仍只有68.7%,失败可能来自抓取、定位、双臂配合或意图预测,论文没有把所有错误都归因于同一模块。
论文表示分析:勺子、胡萝卜、叠方块和茄子任务的意图表示形成不同簇。
下一步是摆脱昂贵教师并扩展任务范围
INDI适合装配、整理和厨房操作等同一动作前缀可能通向不同目标的任务。后续要测试更长指令、更杂乱环境、失败恢复和人机协作,并评估教师模型在陌生物体上的误判。
若意图表示能由更小模型或机器人自身经验生成,训练成本会下降。当前结果证明“显式行为目的”能改善指定VLA模型,但真实平均成功率仍为68.7%,离无人看护部署还有明显距离。
部署系统还需要在意图不确定时暂停或请求帮助。把错误目标编码得更清楚,反而可能让机器人更坚定地执行错误动作,因此意图监督应与在线验证、碰撞约束和失败检测配合。
参考资料
https://arxiv.org/abs/2608.23478