论文导读
英伟达、斯坦福大学、伊利诺伊大学厄巴纳香槟分校等机构提出ARC,让已有机器人模型在行动前补上原因、目标和步骤。在28项配对实机任务中,π₀.₅的成功率从9.5%升至91.7%。团队重新标注已有演示,机器人由此更稳定地完成交换碗盘、整理物品等多步操作。
先挪开香蕉,再交换碗盘
让机器人交换碗里的东西和盘里的东西,光会抓取还不够。盘子可能已经被占满,香蕉也可能挡着落点。机器人需要先找临时位置,把东西挪开,再按顺序转移,最后恢复摆放。ARC把这些动作前提写进了机器人能使用的推理记录。
每条记录围绕眼前场景回答几件具体的事:现在有什么、为什么要动、希望改变什么、下一步做什么、哪些碰撞或误操作要避免、任务是否已经完成。它比单纯列出“抓起、放下”更具体,能把目标和当前动作连起来。
论文展示的交换任务中,机器人会暂时移开香蕉,腾出空间后再搬其他物体。演示图按时间列出动作和解释,让读者能看到推理如何对应实际执行,而不是只看到一句最终成功。
图:机械臂暂移香蕉、转移积木并完成碗盘交换,文字对应每一步动作。
给旧演示加解释,再教模型使用
团队没有再采集一批机器人轨迹,而是给DROID已有演示增加动作解释。自动标注流水线先分析视频,找出重要场景和物体关系,再生成与动作对齐的推理记录。得到的数据约含7.5万次演示、120万帧标注。
图:ARC把现有演示补上因果记录,再用这些记录微调机器人控制模型。
训练时,机器人同时读任务要求、相机观察和这些解释,学习预测演示中的动作。研究覆盖π₀.₅与Cosmos3-Nano-Policy两类已有模型,并根据各自结构调整微调方式。重新利用旧数据仍然需要标注和训练成本,“不加新演示”不等于完全不训练。
实机运行把两件事分开:后台视觉模型刷新对场景的判断,控制器继续使用最近一条有效解释驱动机械臂。论文示例中,推理约每秒更新一次,机器人控制为15Hz,避免每个小动作都等一整段文字生成。
实机91.7%,仿真结果单独看
配对实机评测重建了28项推理相关任务,涵盖多步操作、探索、排除指定物体和理解现场条件。π₀.₅加ARC达到91.7%,原模型为9.5%,提升82.2个百分点;Cosmos3-Nano-Policy基线为11.9%。这些数字来自同一套桌面硬件任务。
在仿真的RoboLab-Reasoning-50上,Cosmos3-Nano-Policy从11.0%升至61.0%,π₀.₅从10.2%升至57.0%。一般操作任务也有改善:MolmoSpaces上,两者分别提升18.6和27.2个百分点。不同基准衡量的任务不同,不能把实机91.7%套到全部操作场景。
对照实验还发现,只把动作分成文字子任务,提升远小于完整的因果记录。完整微调比仅训练动作部分效果更好,说明控制模型需要学会区分这些解释里的条件和目标。
图:人手改变桌面物品后,机械臂更新目标;右侧展示朝错误容器移动后的修正。
让现场变化进入下一步动作
论文还展示了人手临时加入或移走物体时,机器人重新检查桌面并调整目标;另一个案例中,机械臂朝错误容器移动后,根据更新的解释修正方向。这些演示把推理的用途落到了现场变化和操作恢复。
后续落地可以继续检验这种异步运行方式:在更拥挤的桌面、更长的操作流程中,记录何时需要更新解释,以及更新后是否减少重复抓取。论文已有实机轨迹和多种指令详细程度的评测,可作为进一步比较的起点。