论文导读
浙江大学、上海交通大学、上海人工智能实验室、香港大学联合提出OmniHOI,把单目人手操作视频转成灵巧手轨迹。60段视频的端到端仿真测试成功率为53%,对照方法为28%。团队还让两只实机灵巧手执行插入、叠放、倒水等七类操作,展示从视频到动作的转换。
手看着像在抓,物理上也要抓住
OmniHOI先从普通RGB视频里恢复手、物体和桌面的关系,再把人的动作转给机器人。画面里手指贴着杯子,并不保证三维重建真的接触杯壁;错误的深度还可能让手指穿过物体。直接照抄这种动作,机器人就可能推开物体或抓空。
流程因此分阶段检查:重建时用图像校正手的位置,转到机器人手时保留接触部位,最后在仿真里检查物体是否按要求移动。每一步先修正当前错误,再把轨迹交给下一步,减少错误一路累积。
论文首图把人手输入与双机器人手的执行放在上下两行。插入小物体、堆叠方块、拿杯子倒水等场景都能直接比较动作对应关系,读者可以看清被转移的操作是什么。
图:上排为人手视频,下排为两只机器人手执行插入、叠放、倒水等操作。
抓住关键帧,再到仿真里试动作
团队不逐帧优化整段视频,而是在动作转向或快速变化的位置保留更密的关键帧,平稳移动时减少采样。关键帧恢复的手和物体关系,再通过插值补成连续轨迹。
人手和机器人手的关节数量、指形不同。转换过程会检查指尖接触的位置,修正穿透、手指交叉和丢失接触。把人的手势对齐到机器手之后,系统还会在物理仿真中反复调整,比较物体轨迹、接触和抓持状态。
最终目标是让物体到正确的位置,手指不必逐毫米复制人的外形。评测用物体运动的位置与角度误差判断操作是否成功。这种定义把重点放在“动作做成了什么”,并允许不同形态的手采用不同抓法。
图:视频关键帧经过手物体重建、接触约束转换,再在仿真中修正轨迹。
53%来自仿真,实机演示另列
端到端测试从已有视频中挑出60段遮挡较少、手与物体占画面较大的片段,采用XHand进行仿真回放。成功要求位置轨迹误差低于10厘米、转动误差低于0.5弧度;双手任务中的两个物体都要达标。OmniHOI为53%,VideoManip为28%。
另一项测试从干净动捕轨迹出发,每种手转换150条轨迹。五种手的成功率为39%至89%,较高自由度的四种手达到85%至89%。这项测试输入条件更干净,不能与从视频直接开始的53%互换。
实机部分执行七个自录任务,使用装在UR5e机械臂上的两只XHand。扫动和叠放的连续图展示了人手输入与机器人执行。论文未把这些演示汇成53%的实机成功率,视频重建和轨迹执行仍是分开的检查环节。
图:扫动和叠放按时间展开,上排机器人执行、下排人手输入,展示操作对应。
应用前景:把视频转成可执行的演示数据
这条流程给机器人学习提供了另一种演示来源:先把人类操作的视频变成接触可靠的轨迹,再检查机器人能否执行。论文已比较五种灵巧手,显示手的形态变化可以在转换环节处理。
进一步扩展时,可以沿着视频遮挡、物体几何和不同手形分别测试,让重建误差与执行误差更容易定位。现有实机插入、倒水、擦洗和叠放任务提供了可重复检验的动作类型,后续数据建设可以围绕这些具体操作展开。