论文导读
加州大学伯克利分校、Sharpa Robotics、香港大学等机构提出GALATEA:先让视频模型生成手与物体的动作,再把画面重建成仿真可执行轨迹。团队落地超过1500段生成视频,仿真训练成功率较基线高出25个百分点以上,并做了真机闭环演示;规模数字主要来自仿真,不代表1500项真机技能。
生成视频动作丰富,机器人却不能直接照抄
给视频模型一句提示,它可以生成手拿起杯子、转动物体或沿桌面推动物品的画面。这些画面看起来合理,却没有机器人控制需要的关节位置、接触力和精确三维轨迹。视频中的手还可能穿过物体,深度比例也会漂移。直接模仿像素变化,策略很容易学到仿真和真机都执行不了的参考动作。
GALATEA把问题拆成两段。训练阶段,生成视频负责提供大量动作创意,系统把它们重建为手和物体的运动,再放进物理仿真中训练跟踪器。部署阶段,视频模型根据新任务给出动作计划,已经学会多物体、多轨迹跟踪的控制器负责把计划变成连续动作。
图1:生成视频经过手物交互重建与仿真跟踪,最终转成可执行控制。
先校准深度,再把接触关系拉回物理世界
重建流程先用首帧深度确定视频尺度,再分割手和物体,估计两者的初始运动与接触时段。随后,联合优化会调整手部姿态、物体轨迹和接触关系,让画面里的动作尽量保留,同时减少穿透、漂浮和不合理跳变。它不要求编辑者逐帧标注,只需要少量人工筛查。
图2:深度、物体掩码、初始运动和接触区间共同用于生成最终手物轨迹。
重建后的参考仍不是控制命令。团队在仿真中让灵巧手反复追踪这些轨迹,学习在不同物体与不同动作之间共享控制经验。论文称超过1500段生成视频被成功接入这一流程,覆盖功能性抓取、非抓持推动,以及抓住物体后继续跟踪目标姿态等类型。
仿真专家均值77.4%,蒸馏控制器遇到新物体为54.2%
项目页给出的仿真结果把42个训练物体、10个基准物体和5个新物体分开统计。GALATEA专家策略在基准设置上的平均成功率为77.4%;把多项技能蒸馏进一个控制器后,它在未重新训练的新物体上达到54.2%平均成功率。论文同时报告,训练阶段的成功率比对照方法高出25个百分点以上。
图3:42个训练物体、10个基准物体和5个新物体上的仿真成功率分布。
真机部分采用闭环控制,会在执行过程中根据观测修正动作。视频展示了多种抓法、推物以及抓取后的姿态调整,但没有把1500段参考全部逐项搬到真实硬件验证。结果说明生成视频可以扩充动作来源,至于长时间稳定性、失败恢复和复杂杂物环境,仍要靠更大规模真机测试回答。
从动作素材库走向可复用控制器
如果生成视频能持续提供可重建的参考,机器人团队就不必为每件物体手工录制完整动作。下一步可把重建质量检查做得更自动,并让控制器识别哪些视频计划超出了机械手的能力范围。项目还需要扩大真机对象、接触材料和摄像机条件,才能判断这种“视频先规划、控制器再落地”的路线能否成为通用灵巧操作的数据入口。
参考资料
https://arxiv.org/abs/2609.10050