论文导读
清华大学、大连理工大学、香港中文大学提出Weave,让人形机器人从人类示范学习边走、边保持平衡、边用双手操作物体。策略同时控制29个身体关节和12个手指关节,在九种物体的训练交互上成功率达到92.5%,无需额外训练执行未见序列时达到65.0%。团队还提供约23小时带接触标注的物理执行轨迹。
抓住物体之前,机器人先得走到正确位置
桌面机械臂通常固定在原地,抓取问题主要集中在手和末端执行器。人形机器人搬椅子、推箱子或操作长杆时,脚步、重心、身体姿态和手指接触相互影响:手伸得更远,身体就要补偿;物体开始移动,落脚点也得跟着改变。
Weave面向的正是这种全身移动操作。论文场景覆盖九种物体与多段交互,机器人需要接近物体、建立接触、维持平衡,再让物体沿目标运动。
论文Figure 1:人形机器人对椅子、箱体、长杆等物体执行多种全身交互动作。
把人类动作改写成机器人能执行的参考
人和机器人的四肢比例、关节范围与动力学都不同,直接照搬人体动作会让手碰不到、脚站不稳。Weave先做接触感知重定向:保留人手与物体发生作用的位置和时机,再把动作改成符合机器人身体结构的参考轨迹。
如果人类示范从已经接触物体的位置开始,系统还会补出机器人靠近和建立接触的动作。策略随后读取物体几何、接触目标和机器人自身状态,统一输出身体与手指命令,而不是把走路和抓握拆成互不相干的两个控制器。
论文方法图:人类—物体动作先经过接触感知重定向与接近动作补全,再用于训练全身控制策略。
训练动作92.5%,未见序列65.0%
论文在九种物体上评估。对训练中出现过的交互,平均成功率为92.5%;把已经学过的基本交互重新组合成训练期间没见过的序列,不增加训练,成功率为65.0%。这个落差说明基本接触技能能够迁移,但长序列中的误差仍会累积。
研究还记录约9000条物理执行轨迹,总时长约23小时。每条轨迹包含机器人和物体运动及接触标注,可继续用于交互策略学习或生成符合物理约束的人—物动作。
论文消融图:不同优化器和策略设计在训练长度与回报上的对比,用于核对各组件对学习过程的影响。
这些数字来自论文设定的九种物体和交互序列,不代表机器人已经能在开放家庭环境随意搬运。真实空间还会出现地面变化、遮挡、物体质量未知和人类干扰。
从动作复现走向可组合技能
Weave把人类示范转换、全身控制和接触数据放在同一条链路里。下一步如果能把推、拉、抬、转向等片段稳定组合,机器人就不必为每个长任务从头采集完整示范。更关键的工程问题是在线纠错:物体滑动或落脚偏离时,策略能否及时重新建立接触,而不是继续追随已经失效的参考轨迹。