论文导读
得克萨斯A&M大学、谷歌DeepMind、卡内基梅隆大学等机构提出TouchScale,记录500小时人类操作时的画面与双手触觉。在四项实机任务中,用这批数据进行中期训练,机器人平均成功率从22.5%升至57.5%。研究把人类操作记录与机器人示范结合,检验接触信息能否帮助完成操作。相同采集设备把“手怎么动”和“手如何接触物体”同步保存,让机器人训练可以利用视频里看不见的压力变化。
摄像头能看见动作,记录不到手指压力
拧湿布、拿试管、擦白板,画面能显示手走过的路线,却不能直接告诉模型手指何时压住物体、接触集中在哪一块。机器人仅凭外观判断接触,遇到软硬不同的物体和需要持续施力的操作,很容易漏掉这类信息。
已有视觉触觉数据规模通常小于30小时。把不同数据集合在一起扩大样本,又会混入传感器布局和采集流程的差别。TouchScale用统一的可穿戴设备收集500小时记录,让数据规模的作用可以单独观察。
参与者佩戴头部RGB-D相机、两个腕部相机和双手触觉手套。每只手套有880个感测单元,覆盖手指和手掌。相机看场景与手部动作,手套记录接触压力,时间戳把这些信号对齐。
图:穿戴式同步采集装置与拧布前后记录(Figure 2)。
同一套设备,采集约2000种任务描述
数据包含约8.7万个操作片段,覆盖约2000条任务描述、超过1500个物体。实验室、厨房、工作台等环境带来不同动作和接触组合;研究团队没有把每条记录标成人类动作控制指令。
模型先从人类记录中学习当前观察与未来触觉变化的对应关系,再用机器人自己的示范学习动作。触觉中期训练时,主要视觉语言动作骨干保持冻结,更新集中在触觉相关部分。这样可以检查,人类接触数据能否给已有机器人策略增加可用的信息。
两组机器人模型都从同一个公开检查点出发,后续每项任务都使用相同的50次遥操作示范。对照组跳过TouchScale中期训练,其他适配流程保持一致,避免把更多机器人示范误算成触觉数据收益。
图:机器人硬件与四项接触操作(Figure 5)。
四项实机任务,从18次成功到46次
实机采用xArm6机械臂和BrainCo Revo 2机器人手,测试软硬物体分类、瓶盖取放、试管转移和白板擦拭。每项20次、共80次评价,平均成功率22.5%与57.5%对应18次和46次成功。
这些操作要求不同:分类要通过接触区分材料,试管转移要精确放置,擦白板则要维持表面接触。论文给出的连续执行画面展示了机器人如何建立接触,再把物体移到目标位置或完成擦拭。
另一组实验固定预测模型,检查它能否在未用于训练的触觉传感器数据上判断接触区域。完整TouchScale训练的接触区域交并比达到0.383,原EgoTouch训练对照为0.134;交并比衡量预测接触区与真实接触区的重合程度,不能读成机器人成功率。
图:四种实机任务的成功执行序列(Figure 11)。
未来应用:把人类接触记录用于更多机器人
目前实机评价只覆盖一套平台和四项操作。论文还发现,预测未来触觉的误差与动作误差之间只有较弱关联,不能简单断定触觉预测越准,动作就一定越好。
扩大机器人种类和接触任务,是作者提出的后续方向。数据中没有人类动作标签,现有结果已经展示一条训练路径:先用同步视觉触觉学接触变化,再用较小规模机器人示范适配动作。接下来可以沿同一采集协议增加记录,并在不同机械手和任务上分别测量收益。
参考资料
https://arxiv.org/abs/2610.10288
https://arxiv.org/html/2610.10288