arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

伯克利让G1手脚并用:踢箱、接箱,还能爬上行李箱

作者:arXivDaily编辑部 arXiv 2610.09117 cs · cs.LG · cs.RO

论文导读

加州大学伯克利分校提出Workhorse,用没有机器人参与的人类示范训练全身操作。宇树G1实机展示手搬纸箱、用脚踢箱、接住抛来的箱子,以及爬上0.39米高的行李箱取物。它把人类的手脚协作转成机器人可执行的接触动作,让身体多个部位共同操作物体。视觉规划与全身控制共用躯干、双腕、双脚的位置姿态,让人类动作能直接参与两类策略的训练。

两只手搬箱,第三个箱子交给脚

Workhorse的分箱任务要求机器人把两个箱子用手放好,再把第三个箱子踢进底部架子。双脚既负责行走,也参与操作物体。另一项实机展示中,G1接住飞来的箱子;行李箱任务则需要推动、翻倒、爬上和取高处物体。

其中行李箱重14公斤,高0.39米。机器人先把箱体移向架子,用腿抵住底部翻倒箱子,再站到箱子上拿高处纸箱,随后跳下。这是一段具体场景中的全身动作展示,不能理解成任意高度或任意箱体都能完成。

图:机器人在货架前搬运纸箱的动作叠加(Figure 1(a))。

人类戴五个追踪器,记录身体如何配合

采集设备包括胸部相机,以及躯干、两手、两脚上的五个追踪器。一个示范者在一个房间完成记录,不需要每次都操作机器人复现动作。

训练时,系统以躯干、双腕、双脚的位置和姿态作为共同接口。视觉规划器根据相机画面与近期身体状态预测这些部位的目标,全身追踪器再把目标转化为机器人关节动作。两部分独立训练,使用同一批人类姿态记录,不先把完整人类关节动作逐一改写成机器人关节动作。

机器人视觉规划器每秒更新5次,全身追踪器每秒更新50次。规划决定未来一段身体部位如何移动,较快的追踪控制负责执行,让上层视觉决策和底层平衡调整可以按不同频率工作。

图:人类示范采集的胸部相机与穿戴追踪器(Figure 3(a))。

训练时提前模拟另一部分会犯的错

分开训练带来一个问题:规划器看到的实际身体状态,可能已经偏离示范;追踪器收到的计划,也可能不够准确。研究团队分别给两部分加入扰动,让它们在训练中接触对方部署时可能造成的误差。

在重建示范房间的仿真测试中,完整系统分箱成功率77%,移除规划器增强后降到20%。带40牛顿秒推动扰动时,完整系统成功率64%,没有规划器增强的版本为0。这里的牛顿秒是推力冲量,不是持续推力大小。

这些成功率来自仿真房间。实机提供的是能力展示和连续恢复画面,论文没有给出对应的实机统计成功率。受扰动仿真中,完整系统仍有15%的回合跌倒,不能把恢复示例当成不会跌倒的保证。

图:重建房间中的G1仿真分箱场景(Figure 9(a))。

未来应用:同样的人类示范,再训练另一种机器人

研究团队把相同人类记录用于另一种人形机器人H2,重新训练视觉规划与追踪策略,仿真分箱成功率83%。这个结果展示的是相同示范可服务不同机器人训练,并非把G1策略原封不动放到真实H2上运行。

后续工作包括真实H2部署,以及把手指、夹爪和头部状态加入共同接口。当前五个身体部位没有描述细致的手指动作,也不能单独控制承载相机的颈部。

采集还受房间内定位基站约束。作者希望使用无需固定基站的姿态估计,把示范带到更多场所。扩展记录环境,再测试机器人在新空间中的表现,能够进一步检验这些全身操作是否摆脱单房间条件。

参考资料

https://arxiv.org/abs/2610.09117

https://arxiv.org/html/2610.09117

https://arxiv.org/pdf/2610.09117

↑