arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

斯坦福让机器人先想画面再行动,仿真长任务成功率97.8%

作者:arXivDaily编辑部 arXiv 2610.07922 cs · cs.CV · cs.RO

论文导读

斯坦福大学提出OpenWAM,把视频预测、机器人动作和动力学组件接进同一框架。模型先在一万多小时机器人与人类交互视频上学习,再训练动作分支。仿真长任务中,视频预训练让成功率从68.4%提高到97.8%;项目还展示了双臂烤面包、转魔方和按颜色整理杯子的操作。

让未来画面成为机器人动作的接口

OpenWAM让机器人既能预测未来看到什么,也能产生完成操作需要的动作。比如桌上面包应当进入烤面包机,视频预测给出未来画面,动作组件再把画面变化转成夹爪运动。

研究把不同连接方式放在相同底座和训练流程下比较。视频与动作可以一起生成,也可以先生成视频再生成动作,或先给动作再预测画面,还能使用彼此连接较少的配置。这样比较时,变化主要来自交互顺序,而不会把不同视频底座、数据和训练办法混在一起。

真实双臂平台由两台Franka机械臂组成,配有两个腕部视角和一个居中的外部视角。实机任务包括放入面包并启动烤面包机、完成二阶魔方最后一层,以及按颜色整理杯子。

图:左侧实机面包、魔方和杯子操作序列,右侧为四项仿真迁移任务。

先看视频,再补动作示范

团队从Wan2.2-5B开始,用一万多小时视频继续训练预测能力,这一阶段不需要动作标签。随后把动作专家接入同一架构,在目标任务示范上训练视频与动作的关联。

图:机器人视频预训练、视频动作连接与独立动力学组件的总体流程。

框架还把两个动作相关功能独立训练。一种输入当前和未来画面,预测需要做什么动作;另一种输入动作,预测画面会怎样变化。前者把视觉计划落到控制指令,后者检查动作可能带来的结果。

为了让组件看到示范之外的变化,研究在仿真里从同一个起始状态执行不同动作序列。成功、失败和探索得到的短期状态变化都能提供训练信号,不必只收集已经完成任务的录像。

视频与动作在共同的信息通道里交换内容,同时保留分别处理两种输入的分支。

图:视频与动作各自保留分支,通过共享注意力连接历史与未来信息。

97.8%来自仿真长任务

在LIBERO-Long上,先预测视频再输出动作的配置,经过机器人视频预训练与因果适配后,成功率由68.4%升到97.8%。这是指定仿真套件上的结果,不能替代真实环境的整体操作成绩。

组件复用实验只适配新任务的视频预测器,动作转换组件保持冻结。在四项保留任务上,使用反事实数据和示范训练的局部动作组件平均成功率为84.0%;使用完整任务上下文的版本为47.0%,只用示范训练的局部版本为21.5%。

同起点的不同动作结果还用于测试未来画面预测。反事实监督让RGB预测误差减少34.5%,在16种同起点结果里识别正确结果的比例由21.1%升至71.3%。这些指标分别回答动作能否完成任务、未来画面能否区分不同动作,不能互相替换。

下一步,把仿真里的复用搬到真实机器人

独立的视频和动作接口让团队可以检查:换了视觉预测器后,已有动作组件能否继续使用。现阶段的复用证据主要来自仿真,新任务仍需要适配视频预测器,不属于完整模型的零样本迁移。

论文把实机上的组件复用、成本更低的物理交互数据和更长时间的规划列为后续方向。统一框架也能让研究者在同样条件下检验不同视频与动作连接方式,逐项比较控制、预测和复用能力。

参考资料

https://arxiv.org/abs/2610.07922

https://openwam.stanford.edu

https://github.com/OpenWAM/OpenWAM

↑