让人形机器人走到陌生目标前、保持平衡并伸手抓取,需要把视觉导航、全身控制和操作连在一起。加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等机构提出FetchMan,在超过15万个仿真场景中训练,并把策略零样本部署到真实宇树G1。
单物体到达并抓取任务的实机成功率为73.3%。仿真实验还显示,单纯增加脚本示范无法持续提高行为克隆:单物体克隆停在67%,Flow-GRPO强化学习将其推到83%;多物体设置中,克隆最高40%,强化后达到62%。
会走和会抓不能分成两套孤立策略
桌面机械臂通常固定在目标前方,人形机器人则要先移动到合适位置,过程中持续调整身体、手臂和视角。走得太近会失去操作空间,伸手时重心变化又可能破坏平衡。将导航与抓取分开训练,接口误差会在接近目标后集中暴露。
FetchMan使用视觉移动操作策略,把相机观测和目标信息映射到全身行为。底层全身控制器负责执行并维持稳定,上层策略学习何时靠近、如何调整身体以及怎样完成抓取。
论文展示仿真场景、策略结构及宇树G1在真实环境中走向并抓取目标。
真实人形机器人示范昂贵且风险高,团队把数据生产搬到仿真。超过15万个场景覆盖物体、位置和环境变化,为视觉泛化提供规模;策略训练完成后不再用目标真实场景做专项微调,直接进行零样本实机测试。
行为克隆加数据,成绩仍会过早见顶
第一阶段由脚本控制器在仿真生成示范,模型执行行为克隆。作者发现,继续增加示范数量并未突破性能上限:脚本本身覆盖的动作模式有限,克隆策略只能逼近这些轨迹,遇到偏离示范的状态时缺少恢复经验。
单物体仿真中,行为克隆约停在67%,Flow-GRPO在线强化后达到83%。
第二阶段采用Flow-GRPO,用单一稀疏奖励在仿真中在线优化克隆策略。只有任务结果提供主要反馈,策略通过探索补上脚本示范未覆盖的动作。克隆提供可用起点,强化学习负责突破上限,避免从随机策略直接学习整套全身动作。
多物体训练把选择也加入任务
单物体场景只要求找到并抓取指定目标,多物体场景还要在多个候选中识别目标、规划接近方向并避开干扰。论文将同一训练配方扩展到多物体设置,行为克隆最高40%,Flow-GRPO达到62%。
多物体仿真任务更难,强化学习把成功率从克隆上限40%提高到62%。
训练链把脚本示范、克隆初始化和在线强化串在一起。仿真可以快速重置失败、随机化场景并收集大规模探索轨迹,真实机器人只承担最后的迁移验证,降低摔倒和碰撞带来的数据成本。
第一阶段克隆脚本示范,第二阶段在原策略上执行Flow-GRPO在线强化。
实机73.3%来自论文设定的单物体到达抓取任务。它没有覆盖拥挤公共空间、柔软或易碎物体、长时间连续操作,也不能说明每类未见目标都达到相同成功率。仿真到真实的光照、接触和动力学差异仍是主要误差源。
从单次抓取扩展到连续移动操作
FetchMan证明大规模仿真、行为克隆和强化学习可以共同训练人形机器人的视觉移动抓取。仓储取物、家庭递送和实验室搬运都需要这类走—抓一体能力,但部署标准会高于单次成功率:机器人还要安全绕人、判断抓取失败并重新尝试。
下一步应增加多物体实机结果、连续任务和失败恢复,报告碰撞、跌倒、耗时与能耗。若策略能在抓取后继续搬运、放置并接受下一条指令,才会从单技能演示走向移动操作系统。当前73.3%给出一个明确实机起点,也保留了约四分之一失败需要解决。