arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

机器人自己收拾烂摊子,英伟达团队把实机成功率推到87.5%

作者:arXivDaily编辑部 arXiv 2610.01178 cs · cs.RO

论文导读

英伟达、加州大学圣迭戈分校和得克萨斯大学奥斯汀分校等机构提出Recova,让机器人失败后先修复现场,再继续任务。四项桌面实机任务平均成功率达到87.5%。人工接手的示范也进入训练,成为以后可复用的纠错动作。

卡住以后,先把现场救回来

铅笔横在盒口,盒盖就关不上;套环歪着卡在立杆顶端,机械臂继续执行原来的动作也未必有用。Recova把这类障碍单独交给恢复策略处理,不要求原来的任务策略同时学会所有补救办法。

机器人做任务时,一个视觉语言模型持续查看进度。它检查是否完成,判断场景是否受到扰动,再从已有技能里寻找合适的纠错动作。动作结束后还要确认现场已经能继续工作,任务策略才重新接管。

恢复动作有不同用途:扶正物体可以还原场景,把托盘拉回可以创造下一步条件,换一个抓取姿势则能避开反复失败的路径。它们按照具体障碍命名,同一种障碍再次出现时可以复用。

图:论文图5并列展示笔盒整理和套环任务的模拟纠错与实机恢复动作。

在模拟桌面里练,回真实机器上验

直接在机器上探索失败,操作员就得不断复位,还可能损坏物体。团队先根据摄像头观察、机器人轨迹和可用的相机标定重建数字桌面,调整物体位置与接触参数,让模拟回放尽量贴近真实记录。

编程智能体在这张桌面上尝试任务,遇到失败后诊断原因、编写补救程序并测试。成功完成任务的轨迹用于训练任务策略,成功纠错的轨迹则进入恢复策略;可复用的程序另存为技能库。

真实机器仍会遇到模拟没覆盖的接触与感知差异。自主恢复找不到办法或执行失败时,人类提供示范。系统区分这次示范是在教任务还是教恢复,分别送入对应的数据集,避免把两种目标混成一份训练材料。

图:论文图2将模拟探索、任务策略和恢复策略连接到真实机器的监测与示范循环。

87.5%来自四项受控实机任务

在六种LIBERO-Pro设置中,Recova的平均成功率为78.8%,比较中最高的基线为71.7%;在MolmoSpaces四类任务中,分别为64.9%与38.0%。这两组属于模拟测试,不能与实机成绩合并计算。

四台真实机器人工作站并行收集数据后,任务策略微调将四项任务平均成功率从23.8%提升到77.5%。加入恢复技能后,平均值再增加10个百分点,达到87.5%。这里测量的是完成受控桌面操作的能力,尚不能外推到陌生家庭环境。

论文还追踪了一个任务的四轮收集:人工干预率从第一轮87.5%降到第四轮0%。图中的末轮任务成功率为85.7%,它与四项任务平均87.5%是两个口径。零干预也只描述该任务该轮的观测结果。

图:论文图4左侧是四台并行工作站,中间为一次收集时序,右侧是单任务四轮成功率与人工干预变化。

应用时把接手示范留给下一轮

这套系统安排一个操作员监督多个工作站,只在任务或恢复无法继续时请求接手。连续两次干预后,下一次尝试改为完整人工示范,避免机器和操作员陷入相同失败的循环。

每轮收集时策略保持固定,结束后再用新经验更新。机器人成功完成的任务、人类完成的任务,以及人类展示的纠错动作都有明确去向;一个失败不必只留下重置记录,也可以留下下一轮能够学习的动作。

项目页展示了真实操作与恢复过程。对后续使用者,仍需在自己的物体、相机和桌面布局上核对恢复是否可靠,并检查视觉监测是否会误判完成或复原。论文验证的是把探索、恢复、人工示范和训练连接起来的流程。

参考资料

https://arxiv.org/abs/2610.01178

https://arxiv.org/html/2610.01178

https://arxiv.org/pdf/2610.01178

https://www.liuisabella.com/Recova

↑