论文导读
亚马逊FAR、加州大学伯克利分校、卡内基梅隆大学、斯坦福大学等机构提出PRISM,把少量真人示范扩成数百段反事实视频,再转成可训练的人形机器人轨迹。策略不做真实世界微调,也能让机器人拾取、搬运并放下未见过的箱子、桶、筐和球。
几段视频变成一批新经历
训练人形机器人搬东西,理想视频要同时拍全人体、物体接触和行走过程,采集成本很高。PRISM先从少量真人样例出发,用视频到视频生成改变人的姿态、物体尺寸、接近距离和场景条件,得到数百段“如果当时换一种情况”的交互片段。
图:真实人形机器人抱球接近收纳桶,展示完整搬运场景。
生成视频并不天然符合物理规律。团队用接触点作为锚,把人体和物体运动恢复到仿真环境,再把动作重定向给人形机器人。这样,画面里偶尔不精确的手脚位置不会被原样当成控制命令,而是经过动力学约束变成可执行轨迹。
在仿真里学,直接上真机
同一类别里的反事实变化让策略见过不同大小、初始位置和搬运姿态。训练完成后,机器人只依赖机载深度观测,在真实场地执行接近、弯腰、抓取、起身、行走和放下的连续流程,部署前没有再采集真机示范做微调。
图:样例网格呈现姿态、尺度和接近距离等反事实变化。
实验展示了箱子、桶、筐和球等类别的未见实例。这里的泛化范围仍由训练类别和场地设置限定,不能理解成任意形状、重量或材质都能稳定搬运;但从“每个新物体都要录视频”走到“用生成变化覆盖一类物体”,已经显著改变数据扩展方式。
接触锚点是关键过滤器
视频生成负责提供多样性,仿真重建负责守住可执行性。PRISM重点恢复人与物体何时接触、接触后如何共同移动,再利用仿真中的力和关节限制修正轨迹。相比只模仿像素,这个中间层让训练数据既保留真实外观,又能接受物理检查。
图:实机搬运与仿真接触受力并列展示真实到仿真的转换。
项目图中的多种姿态、尺度和接近距离对应的是数据增强维度;仿真受力图则说明重建后的物体和机器人需要满足接触约束。两部分共同避免模型只记住一条漂亮视频。
走向更广的搬运技能
下一步需要扩大物体材质、重量分布、地面条件和失败恢复测试,并公开重复试验的成功率、跌倒率与人工接管次数。对于仓储和工厂,是否能在负载未知、抓取滑动或路径被挡住时安全停下,比完成一次演示更重要。
这条路线也可延伸到推车、开门和协作搬运:先用生成视频快速覆盖动作变化,再用接触约束筛选可行轨迹,最后在少量真机测试中校准安全边界。它把真人视频从稀缺成品变成可扩写的训练种子。