论文导读
MIT联合英伟达、新加坡国立大学、宾夕法尼亚大学提出RAPID。机器人只需看一遍人类的视觉演示,就能自动生成、验证并精化自己的控制程序,8项接触丰富的真机任务平均成功率达75.9%。机器人新技能的部署有望不再依赖工程师逐行写代码。
一个演示,缺的三样东西都得自己补
写代码的智能体已经很擅长解决复杂编程问题,团队想把这种能力搬到机器人身上:给它看一段人类操作视频,让它自己写出能完成同样任务的机器人程序。
但代码智能体的闭环精修需要三样东西——可测试的任务规范、机器人能执行的动作基元、能运行并验证程序的交互环境。在机器人场景里,这三样通常都要工程师手工准备。RAPID的关键突破,是从单个视觉演示中自动推断出全部三样,让“看演示—写程序—跑验证—再修改”的智能体循环真正转起来。
图:示意图展示人类演示如何被转化为可执行、可验证的机器人程序。
记“关系”而不是记“动作”
如果程序只会复刻演示里的具体动作,换个位置就失效。RAPID采用对象中心的关系程序表示,关注演示策略背后的结构,而不是某一次的具体运动。
它把动作基元表达成轨迹优化程序,实现的是对象层面的运动效果;再用关系约束把这些基元组合起来,在运行时读取当前场景的几何关系。于是物体换了位姿、形状甚至材质,程序都能现场重新计算,而不是调用写死的动作模板。
仿真八任务加真机,平均成功率75.9%
团队在仿真中评测了8项接触丰富的非抓握操作任务——这类任务不靠抓住物体,而是推、拨、刮、翻,对接触和精度要求很高;同时在LIBERO-Pro基准上验证了常规抓握操作。随后又把系统部署到真实Franka机械臂上,在全部8项非抓握任务中实测。
下图给出真实实验的设置,机械臂在变化的场景中执行自动生成的程序。
图:实验场景中Franka机械臂面对桌面物体,按生成程序执行接触操作。
8项真机任务、每项50个场景下,RAPID平均成功率为75.9±2.4%,并在物体位姿、形状、材质和环境变化上都表现出泛化能力。下图直观对比了程序在不同场景下的执行轨迹,同一程序能自适应不同几何。
图:可视化结果对比同一程序在不同物体配置下规划出的运动路径。
消融实验也说明了各模块的必要性:去掉关键组件后,真机成功率降到53.2%甚至14.6%,而只做简单动作复制的基线CaP仅有1.3%。
未来落地:让“演示一遍”成为机器人的编程方式
这项工作指向一种新的部署范式:使用者不必写代码,只需做一遍操作,机器人就能产出可复用、可验证的技能程序。项目网站公开了全部真机与仿真结果,便于比较和复现。
下一步的研究空间包括从演示中处理更复杂的长程任务、应对演示本身存在误差或失败的情况,以及把这种自动编程扩展到双手和移动机器人。随着模块成熟,机器人技能的生产方式可能从“工程师定制”走向“现场演示即生成”。