arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

机器人终于会“摸”了:伯克利触觉模型六项任务全胜

作者:arXivDaily编辑部 arXiv 2609.24976 cs · cs.AI · cs.CV · cs.RO

论文导读

伊利诺伊大学厄巴纳-香槟分校、加州大学伯克利分校、西北大学提出DexTacWAM,让双手机器人同时预测视觉变化和十个指尖的接触变化。它在六项接触密集任务上全部取得最高分,平均70.6分,而最强基线为38.0分。

相机能看见物体,却看不见抓握是否稳定

双手交接方块、用夹子夹番茄、分开叠放的碗,都有大量被手掌和物体遮住的接触。画面可以告诉机器人“手已经靠近”,却难以判断指尖是否打滑、夹力是否合适、物体是否真正被托住。只把当前触觉值附加给动作网络,也无法说明下一秒接触会怎样变化。

DexTacWAM把每根指尖的触觉独立编码,再按手指身份和手部姿态压成两只手的紧凑表示。这个触觉潜变量被注入视频扩散世界模型,模型学习的不只是下一帧长什么样,也包括接触分布如何随动作演化。

图:十路指尖触觉经过压缩后进入视觉触觉世界模型,并驱动六类双臂操作任务。

六项任务都需要“摸着做”

实机平台有22个自由度。六项任务包括方块放置、双手交接、擦白板、用夹子搬运番茄、分离叠放碗和旋开瓶盖。它们分别考验遮挡下的接触确认、持续摩擦、双手配合和力的变化,不能只靠识别物体位置完成。

DexTacWAM六项平均70.6分,最强对照方法平均38.0分。逐项结果中,它都取得最高分。论文没有把一次成功简单归因于“增加传感器”,而是继续比较相同触觉特征在不同建模方式中的表现。

图:机器人连续完成方块放置、交接、擦拭、夹取番茄、分碗和旋盖的关键帧。

触觉要进入世界预测,而非只当额外输入

消融实验最能说明差别。保留同样的触觉特征和动作专家,但移除“触觉世界建模”后,四项任务均分从74.7降到26.6。模型需要预测接触怎样随动作发展,才能在即将滑落或碰撞前调整,而不是等触觉数值已经变化才反应。

团队还冻结预训练视觉VAE,只用约每项100条示范、四小时触觉编码器适配,把视频先验延伸到触觉。压缩器保留89.4%的融合前接触召回率,同时训练加速2.26倍、推理加速1.29倍,视觉预测质量与纯视觉版本相差不超过0.5 dB。

图:机器人操作关键帧与各指尖触觉热图按时间对齐,显示接触状态随动作推进而变化。

下一步让触觉模型跨过不同手和物体

当前结果来自一套双手机器人、六项桌面任务和约百条示范的设置。产品化要继续检验传感器磨损、不同材质、手型变化以及更长任务中的误差累积。论文证明的核心能力很具体:预训练视频模型可以用较少触觉数据学会预测多指接触,并直接改善真实机器人操作,也为跨硬件迁移留下了明确检验项。

参考资料

https://arxiv.org/abs/2609.24976

https://arxiv.org/pdf/2609.24976

https://dextacwam.github.io/