论文导读
香港科技大学、浙江大学、腾讯Robotics X、湖南大学提出直接驱动人形机器人的遥操作策略,让人体动作不用先做在线重定向,就能转成G1的关节指令。在统一仿真环境里,指令链路延迟为0.604毫秒。它还能从部分或带噪声的动作输入恢复合理的全身动作,支持VR、光学动捕和视频等输入方式。
人体动作直接变成G1关节指令
人类和机器人身材比例、关节结构不同,遥操作系统常要先把人的动作重新映射到机器人骨架,再交给控制策略。这个在线转换会增加等待时间,转换出的目标也未必符合机器人的运动条件。
这项工作把转换并入学习好的策略,部署时直接接收人体观察和机器人自身状态,一次推理输出动作指令。训练仍使用处理过的动作库与教师策略,省掉的是运行中的在线动作重定向,不能理解成训练阶段完全不需要相关数据。
论文使用宇树G1,在仿真和实机上检查跟随动作。输入来源包括虚拟现实设备、光学动捕、文字生成动作和单目视频,能够覆盖不同完整程度与噪声水平的人体观察。
图:佩戴VR设备的操作者与G1在实验室里的连续动作帧。
用动作原型补齐看不到的部分
系统学习了一套离散的全身动作原型。面对只有部分关键点或含噪声的输入,它先把观察对应到合理动作原型,再恢复可供机器人执行的全身状态。
教师策略在训练阶段拥有更丰富信息,随后把能力传给部署使用的学生策略。学生一边结合人体观察,一边利用机器人自身的历史状态,避免直接把不合理输入原样转成动作。
论文比较了动作码本与普通连续预测学生。带码本的版本在部分观察、关键点扰动等条件下更稳,速度相关误差也有所下降。这项恢复能力来自学过的原型,并不说明任意未见动作都能正确还原。
图:教师训练、动作码本匹配及部署时直接生成机器人指令的结构。
0.604毫秒与147.5毫秒,是两种延迟
在相同机器、单环境、批量为一的仿真运行条件下,团队把指令链路拆成前瞻等待、重定向和策略推理。新方法不需要前两项,合计为0.604毫秒;TWIST为22.372毫秒,主要耗时来自重定向。
实机视频测量包含感知、通信、控制周期和执行器响应。团队对一段5秒动作片段中的操作者与机器人手臂运动做对齐,得到147.5毫秒的中位延迟。标题中的0.604毫秒仅指仿真指令处理,不能写成机器人真实反应只需这么久。
在统一加入0.1米关键点噪声的跨仿真测试中,动作码本学生完成率达到95.90%,七项跟踪指标中六项最好。另一组较强噪声测试里,0.30米扰动下完成率为94.87%,普通学生为86.75%。这些比例按参考片段完成与骨盆高度误差条件统计,不等于所有人类动作的跟随准确率。
单目视频示例把上方的人类输入帧与下方G1执行帧并排展示,能够观察动作跟随关系。
图:上排人类视频输入帧,下排G1按估计动作进行跟随的序列。
把恢复能力扩展到连续动作与接触
实机示例展示了不同输入驱动G1做全身跟随,单目视频输入也能经过动作估计接上策略。使用者可根据设备条件选择观察方式,再分别测量输入质量与真实响应时间。
当前码本按单帧组织,没有显式建模较长时间的动作结构。论文计划研究时间连续的动作原型、带不确定性的恢复和接触感知遥操作。这些方向对应长动作衔接、缺失信息与接触控制,需要在实机上逐项检验。