论文导读
加州大学伯克利分校提出形态测量模仿框架,先把人手动作跨手形重定向到机械手上并保持接触,再用残差强化学习补齐动力学差异,最后蒸馏成视觉运动策略。仅用3双手、10段手物交互视频,就在300次真机试验、30个未见物体上取得89.3%的零样本成功率。网上海量人手视频,这下真能变成灵巧手的训练教材。
海量人手视频,为什么一直用不上
人每天都在与物体打交道,网上也有海量的手物交互视频,理论上这是训练灵巧手机器人最丰富的教材。问题在于:人手和机械手的形状、关节数、自由度、驱动方式都不一样,同一个抓握动作直接搬过去,手指往往对不上、接触点全丢,动作一开始就穿模或打滑。
已有的动作重定向方法大多只对齐指尖位置或手部姿态,关注的是“看起来像”,却没有显式保住人手与物体之间的接触关系。一旦接触模式改变,后续的动力学就完全不同:人能捏住的东西,机械手可能一发力就掉。
图:总览图展示从单段人手交互视频出发,经重定向与策略学习,在多种灵巧手上复现同一操作的完整链路。
MMO:边保接触边换骨架
方法的第一步是形态测量优化(Morphometric Optimization,MMO)。它不再只追求关节轨迹在几何上相似,而是把人手与物体间的接触位置、接触面积作为必须保持的约束,在人手和机械手形态差异巨大的情况下求解一条运动学可行的重定向轨迹。
简单说,就是“换骨架”的同时把接触原封不动地保留下来:哪根手指贴在物体哪一侧、用多大的接触面,都尽量映射到机械手对应的部位。
图:方法图分形态匹配、接触匹配、机器人位姿恢复三阶段,展示MMO如何对齐手形并保持接触。
残差强化学习补齐动力学
运动学重定向解决了“姿势对不对”,但机械手的质量、摩擦、延迟与人手不同,同一条轨迹在真实硬件上未必稳。团队用残差强化学习补上这一层:以人手动作中的物体位姿和接触信息为参考,让策略在重定向轨迹之上学习一个修正量,产出动力学真正可行的演示,再把这些演示蒸馏成一个直接看图像、输出动作的视觉运动策略。
在3种机械手、10类手物交互上评测,MMO生成轨迹的接触F1相比5个最强基线,每只手都至少高出8个百分点;接入下游任务后,动态重定向的成功率最高提升35个百分点。
图:结果图按手电筒、方块、苹果等六类物体给出真机执行帧,标出抓取、握持等动作阶段。
最有说服力的是真机结果:训练只用到10段交互视频,策略在30个未见过的物体上完成300次零样本试验,总体成功率达到89.3%。
未来落地:让互联网视频成为灵巧手的训练场
这套方法把“看人手视频学操作”从演示拉到了可量化的真机水平,意味着家庭整理、产线分拣、工具使用等灵巧操作任务,未来有望直接从海量人类视频中低成本获取监督信号,而不必为每个场景遥测采集大量机械手数据。
下一步可以覆盖更多手形和更复杂的双手协作、延长可处理的视频长度,并把接触-rich的操作与语言指令结合起来。当任何一段人手演示都能可靠迁移到任意一只机械手,灵巧操作的规模化学习才算真正打开了入口。