论文导读
香港大学、上海交大、Xense Robotics、宾夕法尼亚大学提出PEARS,把视觉结果和指尖触觉一起用于机器人适配。机器人每次失败后先判断接触力度是否合适,再调整下一轮动作。在实机测试中,它擦白板20次成功19次,移液20次成功18次,用少量交互修正预训练策略的操作。
擦得动白板,先要找对力度
机器人抓住白板擦之后,沿表面移动不等于能擦干净。接触力太小,笔迹还留着;力太大,擦子又可能滑脱。移液任务也有相似要求:夹持力既要足够握稳移液器,又不能把里面的液体挤出来。
预训练策略遇到新的物体或接触条件时,常常需要重新适应。直接让机器人不断试错,既耗时,也可能损坏物体。PEARS保留原有动作模型,把额外学习集中在动作修正与接触力调整上。
这项工作使用视觉画面、机器人自身状态和指尖力与力矩信息。画面告诉系统操作最后发生了什么,触觉记录则帮助判断接触时用了多少力,二者提供不同的错误线索。
图:触觉策略、失败推理与力控制的连接,下方展示仿真及实机任务。
一次失败,拆成力度与动作两类问题
每轮操作结束后,系统检查最终画面和完整接触记录。视觉语言模型结合物理常识,判断是否因为用力不足、用力过大而失败,再给出下一轮适用的力范围。这个范围在一轮内部保持固定,轮次之间更新。
实际接触由较快的底层控制器执行力度约束,其他运动方向仍跟随动作策略。擦白板时,向板面压的方向要管住力度,沿板面移动的方向则负责完成擦拭路径。
另一部分学习修正对齐位置、自由空间运动和接触时机。它调整冻结动作模型接收的输入,不改动底座权重。如果失败主要来自位置或轨迹,系统保留当前力度范围,把纠正任务交给动作适配。
图:上方接触力曲线与下方白板擦接触、移动、释放过程对应。
实机19次与18次成功,都是20次测试
实机实验包含擦白板和移液两项任务,每项先提供50条离线示范,再给适配方法40轮在线交互,最后进行20次测试。擦白板的基础策略成功11次,另一适配基线成功15次,PEARS成功19次。移液对应的成绩为8次、12次和18次。
仿真另测了薄片搬运、拧瓶盖和脆弱水果采摘。PEARS最终成功率分别为94.7%、87.7%和77.7%,超过各任务最好的被测基线12.4至37.4个百分点。不同任务的最优对比方法并不相同,不能把这一范围写成统一增益。
在拧瓶盖的在线适配曲线上,达到80%目标成功水平所需轮数为22轮,最快基线为47轮,减少53.2%。这是仿真适配效率,不能当成实机操作速度提高,也不代表所有任务都减少同样多的试验。
图:三个仿真任务的在线成功率随交互轮数变化,阴影表示跨运行波动。
把失败诊断扩展到更多操作
PEARS把昂贵的实机试错拆得更具体:力控制负责接触边界,动作适配负责位置和时机。项目展示了移液与擦拭的前后对照,可以观察到操作完成方式的变化。
目前,物理推理模块主要针对力度引起的失败,其他错误仍依赖常规学习修正;实机成绩也来自少量受控测试。论文计划把失败推理扩展到探索和策略更新,让系统在接触之外也能利用明确错误线索安排下一轮尝试。