arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯Robotics X等让G1直接跟人动,仿真指令延迟仅0.604毫秒

作者:arXivDaily编辑部 arXiv 2610.07891 cs · cs.RO

论文导读

香港科技大学、浙江大学、腾讯Robotics X、湖南大学提出直接驱动人形机器人的遥操作策略,让人体动作不用先做在线重定向,就能转成G1的关节指令。在统一仿真环境里,指令链路延迟为0.604毫秒。它还能从部分或带噪声的动作输入恢复合理的全身动作,支持VR、光学动捕和视频等输入方式。

人体动作直接变成G1关节指令

人类和机器人身材比例、关节结构不同,遥操作系统常要先把人的动作重新映射到机器人骨架,再交给控制策略。这个在线转换会增加等待时间,转换出的目标也未必符合机器人的运动条件。

这项工作把转换并入学习好的策略,部署时直接接收人体观察和机器人自身状态,一次推理输出动作指令。训练仍使用处理过的动作库与教师策略,省掉的是运行中的在线动作重定向,不能理解成训练阶段完全不需要相关数据。

论文使用宇树G1,在仿真和实机上检查跟随动作。输入来源包括虚拟现实设备、光学动捕、文字生成动作和单目视频,能够覆盖不同完整程度与噪声水平的人体观察。

图:佩戴VR设备的操作者与G1在实验室里的连续动作帧。

用动作原型补齐看不到的部分

系统学习了一套离散的全身动作原型。面对只有部分关键点或含噪声的输入,它先把观察对应到合理动作原型,再恢复可供机器人执行的全身状态。

教师策略在训练阶段拥有更丰富信息,随后把能力传给部署使用的学生策略。学生一边结合人体观察,一边利用机器人自身的历史状态,避免直接把不合理输入原样转成动作。

论文比较了动作码本与普通连续预测学生。带码本的版本在部分观察、关键点扰动等条件下更稳,速度相关误差也有所下降。这项恢复能力来自学过的原型,并不说明任意未见动作都能正确还原。

图:教师训练、动作码本匹配及部署时直接生成机器人指令的结构。

0.604毫秒与147.5毫秒,是两种延迟

在相同机器、单环境、批量为一的仿真运行条件下,团队把指令链路拆成前瞻等待、重定向和策略推理。新方法不需要前两项,合计为0.604毫秒;TWIST为22.372毫秒,主要耗时来自重定向。

实机视频测量包含感知、通信、控制周期和执行器响应。团队对一段5秒动作片段中的操作者与机器人手臂运动做对齐,得到147.5毫秒的中位延迟。标题中的0.604毫秒仅指仿真指令处理,不能写成机器人真实反应只需这么久。

在统一加入0.1米关键点噪声的跨仿真测试中,动作码本学生完成率达到95.90%,七项跟踪指标中六项最好。另一组较强噪声测试里,0.30米扰动下完成率为94.87%,普通学生为86.75%。这些比例按参考片段完成与骨盆高度误差条件统计,不等于所有人类动作的跟随准确率。

单目视频示例把上方的人类输入帧与下方G1执行帧并排展示,能够观察动作跟随关系。

图:上排人类视频输入帧,下排G1按估计动作进行跟随的序列。

把恢复能力扩展到连续动作与接触

实机示例展示了不同输入驱动G1做全身跟随,单目视频输入也能经过动作估计接上策略。使用者可根据设备条件选择观察方式,再分别测量输入质量与真实响应时间。

当前码本按单帧组织,没有显式建模较长时间的动作结构。论文计划研究时间连续的动作原型、带不确定性的恢复和接触感知遥操作。这些方向对应长动作衔接、缺失信息与接触控制,需要在实机上逐项检验。

参考资料

https://arxiv.org/abs/2610.07891

↑