论文导读
Meta Reality Labs、加州大学戴维斯分校、北卡罗来纳大学教堂山分校等机构提出GNR,从成功轨迹中学习如何生成机器手动作。HOT3D仿真测试中,采样量只用对照的8.5%,成功率从27.2%升至56.2%。团队由此扩展出约22.3万条可行轨迹,覆盖约3300种物体几何。
先学会抓稳,再转下一个动作
人抓起咖啡壶时,手指形态与机器手不同,照着人的关节位置摆放,可能没有握住壶柄,也可能穿进物体。转换不仅要动作相似,还要让物体沿正确轨迹移动,接触和抓持也符合物理条件。
常用优化方法会对每个演示采样许多候选动作,再在仿真中筛选。上一个演示已经求出成功动作,下一个演示仍从头搜索。GNR把这些成功结果收集起来,训练生成模型,让新候选更接近可行的动作。
论文把普通第一视角视频和高精度动捕作为两种人类演示来源,分别覆盖日常物体和精密操作。它们先转到仿真场景,再由五指机器手执行,图中的机器手结果需要与人类输入区分。
图:人类操作来源与机器手仿真任务并排,展示普通物体和高精度操作两类轨迹转换。
候选先生成,仿真再筛选
GNR接收人类动作参考和物体几何,生成对机器手轨迹的修正。它可以一次生成多个候选,放到物理仿真里检查动作是否完成;也可以给已有优化器提供一个更好的起点,继续微调。
数据引擎先找到能转成可行动作的片段,再改变物体位置、摩擦、质量、运动速度和形状扩展数据。每次扩展都使用相同成功条件过滤,成功轨迹继续用于训练,形成下一轮转换的样本。
这种复用需要前期成功样本。研究在HOT3D中使用2.8万条优化得到的轨迹训练模型,测试则挑选未见物体、动作和几何。生成阶段省下的采样,不等于种子数据与训练完全免费。
图:数据引擎把人类演示转入仿真,筛选成功动作,再扩展物理和几何条件生成新轨迹。
256次采样,测试成功率56.2%
HOT3D测试抽取1000条未见条件下的演示。GNR采样256次的成功率为56.2%,DIAL-MPC采样3000次为27.2%,256约是3000的8.5%。同一测试下,每条轨迹的CPU计算成本下降约7.6倍。
这些成功按仿真中的物体位置、角度和接触条件判定,不能写成实机机器手完成任务的概率。采样量、CPU成本和总耗时也有不同口径,标题的8.5%只指候选采样预算。
数据扩展从780段源动作和33种原始物体出发,加入形状与物理条件变化,得到约36万次候选演示。已有优化器找到约9.5万条成功轨迹,GNR额外补上约12.7万条,合计约22.3万条。数字包括生成和仿真扩展,并非新录制了22.3万段人类视频。
应用前景:精密装配,给优化器一个好起点
论文还测试十字零件插入和旋钮装配。插入任务中,生成候选可以直接执行;旋钮需要对齐到毫米级,再完成旋入,只靠一次生成的整段动作仍不够,使用GNR初始化后再优化可以继续纠正。
不同物体的五指抓持案例展示了数据中姿态的多样性,同一相机视角便于比较手指如何接触物体。研究也用这些轨迹训练模仿策略,并在仿真中测试执行。下一步可以检查学到的策略如何迁移到真实机器手,保留接触和任务完成两类验证。
图:同一视角下,DG-5F五指手以不同姿态抓持多种物体,展示数据中的抓取配置。