让人形机器人学会一个动作,麻烦的往往不是动作本身,而是要把机器人搬到不同房间、不同位置反复采集真机画面。小鹏机器人与香港理工大学提出R2S-EGO:只用6次真实采集、共48个第一视角观测,再让生成模型补出策略可能遇到的画面,宇树G1的实机坐下成功率由10.0%提升到82.5%。
先解决“没见过这个机位”
传统视觉策略依赖训练相机看到的分布。机器人一旦走到采集轨迹之外,桌椅遮挡、透视关系和自身姿态都可能变化,策略便会收到陌生画面。直接增加真机采集当然有效,但成本会随着场景和机位迅速增长,而且每次布置都要保证安全。
R2S-EGO把问题改写成“用少量真实锚点,合成大量可执行视角”。研究者在3个Replica室内场景中各采集少量G1第一视角图像,总计只有48张。系统随后根据策略可能访问的位置生成新观测,并把这些画面作为伪观测加入训练,使策略在真正走到那里之前就先“看过”环境。
少量真实画面负责锚定外观,仿真中的可执行机位负责提出生成查询。
两种代理,分别管动作和几何
随意让图像模型补图并不够:漂亮画面未必对应机器人能到达的姿态,也可能在桌面和墙体处产生错误结构。R2S-EGO因此使用两种互补代理。机器人代理存在于仿真中,给出符合本体运动约束的相机位置与朝向;几何代理则从真实采集恢复场景结构,为生成过程提供表面、遮挡和碰撞线索。
这套分工把“在哪里拍”和“那里应该长什么样”拆开。真实图像作为外观锚点,生成视角扩展覆盖范围;策略训练时仍以真实画面为基准,不是把一个完全虚构的房间当作真值。视觉重建指标也体现出差异:论文报告其PSNR达到19.062,强基线为14.226,说明新增视角与真实环境更接近。
关键不是单张图更好看,而是新机位中的结构和机器人视角能否保持一致。
40次实机测试,成功33次
团队训练了5个独立随机种子的坐下策略,每个策略在仿真中测试25回合,并在真机上测试8次,因此实机结果来自40次试验。R2S-EGO在仿真中的成功率为97.6%±2.2%,对照方法为87.2%±5.2%;更明显的差距发生在实机:前者为82.5%±6.8%,即40次成功33次,后者只有10.0%±10.5%,即40次成功4次。
生成观测最终要接受真机检验,论文以多策略、多次重复测试降低偶然性。
结果说明,稀疏采集真正缺少的可能不是更多相似视频,而是策略会访问却从未被拍到的关键状态。把有限采集预算放在锚定场景,再针对可执行机位补齐观测,比沿固定路线机械增加帧数更有效。
论文还比较了真实采集数量与覆盖效果。新增相邻画面很容易带来冗余,能够跨越视角空洞的查询更有价值。R2S-EGO用仿真可达状态决定“该补哪一张图”,因此生成预算直接服务于策略分布。这里的生成模型不是替机器人学习控制,而是把控制策略缺失的视觉条件补齐;动作标签和奖励仍来自原有训练环境。
下一步扩展到更多机器人技能
R2S-EGO给真机数据采集增加了一种直接的放大方式:先拍少量高质量锚点,再围绕策略真正可能到达的位置定向生成。机器人团队由此可以把采集预算留给新房间和新任务,而不是在同一路线上反复补拍相似画面。
论文目前用“坐下”验证完整流程,机器人动力学、控制器和场景范围保持相对固定。下一步可以把双代理扩展到抓取、行走和人与物体交互,并加入在线纠错,让策略在发现新视角缺口时主动提出下一批生成查询。若不同技能能够复用同一组真实锚点,每进入一个新环境所需的真机采集量还会继续下降。