arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

浙大&上交等给机器人训练时遮住部分信息,双臂任务成功率提升超30%

作者:arXivDaily编辑部 arXiv 2608.22419 cs · cs.CV · cs.RO

双臂机器人同时读取多个相机画面和语言指令时,更多信息不一定带来更稳定的动作。上海创新研究院、浙江大学、上海交通大学、中国科学技术大学等机构提出M3:训练时随机遮掉部分模态通道,不改模型结构,也不增加大规模机器人预训练。三项真实长程任务中,平均全流程成功率比Adapter基线提高超过30%。

论文把问题指向多视角和语言融合的不稳定:注意力落到干扰区域后,动作可能突然跳变,双手交接、摆放和整理任务随即失败。M3的做法很简单,但实验边界也明确——真实测试只有三项任务,结果来自指定双臂平台和基线。

干净演示也会让模型依赖错误线索

查询式视觉—语言—动作模型一次输出一段动作,延迟低,适合双臂协同。训练画面始终完整时,策略容易把某个相机、背景或文字Token当成捷径。换到随机摆放或视角略有变化的场景,这些线索失效,注意力又可能扩散到无关物体。

论文真实案例:M3完成双臂交接,Adapter基线出现夹爪错位和物体处理失败。

M3在训练阶段随机遮蔽语言、单个视角或多个模态组合,迫使策略在证据不完整时继续依据剩余可靠信息预测动作。推理时不遮挡输入,因此不会额外增加部署步骤。

论文方法图:训练期掩码作用于可见Token和语言Token,推理模型结构保持不变。

十项仿真任务先测干净场景和随机场景

团队在RoboTwin 2.0选择十项双臂任务,包括整理物体、交接和摆放等操作。Clean设置用干净演示训练并在同类环境测试;Clean2Rand则把训练好的策略放到随机化场景,专门检查它是否过度依赖背景和固定布局。

论文任务图:RoboTwin双臂操作与真实平台任务共同用于评估模态掩码策略。

相对Adapter,M3在Clean平均成功率上增加21.7个百分点,在Clean2Rand增加11.4个百分点。论文中的“提升21.7%”按表格实际是成功率点差,不应解释成相对百分比增幅。

Clean表格中,Adapter平均为41.0,M3达到62.7;随机场景中,Adapter为3.7,M3为15.1。后者虽然增加11.4点,绝对成功率仍低,说明训练期遮蔽缓解了分布变化,却没有解决复杂随机环境中的大部分失败。

真实任务看完整流程,不只看单步动作

真实平台测试瓶子处理、双臂交接和货架摆放等长程任务。作者区分局部步骤成功与整项任务完成,M3的平均全流程成功率提升超过30%。画面序列显示,差别常出现在抓住物体后的连续动作:基线可能在交接位置偏移,或因注意力转移碰倒目标。

论文真实实验:三项任务的操作序列、双臂平台与不同方法成功率对比。

同一策略还在另一类OpenVLA式骨干上测试。M3-OFT平均成功率为53.5%,高于OpenVLA-OFT的32.2%,说明收益没有完全绑定原始Adapter结构。

论文还分析注意力热图与动作连续性。加入M3后,注意力更集中在操作对象和双手协作区域,部分突变动作减少。这些图解释了可能机制,但热图本身不能证明因果,仍要以同设置下的成功率消融为主。

论文跨骨干实验:M3-OFT、OpenVLA-OFT与Adapter等方法的平均成功率。

下一步要扩大真实任务和遮挡类型

训练期模态掩码不增加推理成本,适合已有VLA模型的再训练。后续需要在更多机械臂、相机故障、语言歧义和真实遮挡下复现结果,并观察随机遮蔽是否会损失需要精细多视角协作的任务。

如果这些测试成立,M3可用于仓储分拣、双臂装配和家庭整理等输入经常不完整的场景。当前论文证明的是一种低改动训练策略能改善指定任务鲁棒性,还不能替代传感器冗余、碰撞检测和部署安全控制。

实际训练还需选择遮蔽概率。遮得太少,模型继续依赖捷径;遮得太多,又可能学不到需要同步观察两只手的细节。不同机械臂与相机布局应重新做消融,不能直接复制论文超参数。

参考资料

https://arxiv.org/abs/2608.22419

https://arxiv.org/html/2608.22419

https://m3vla.github.io/