论文导读
加州大学洛杉矶分校提出Visible Touch,把接触位置渲染成机器人视觉策略能直接读取的画面标记,不必另建触觉编码器。接上团队自制的低成本磁传感器后,π0.5在四项真实接触任务中的成功率平均提高30个百分点;这个结果只对应论文测试的任务,并非所有机器人操作。
机器人有触觉,却未必会用
很多视觉语言动作模型依赖相机和本体状态。要加入触觉,常见办法是增加专用硬件、独立编码器或更换策略主干,这会让现成的图像模型难以复用。Visible Touch换了一个思路:不要求模型学习一种新数据格式,而是把接触信号投回相机坐标系,用箭头、圆点等覆盖层标出碰到的位置、方向和强弱。
论文项目图:接触传感信号被映射到原有相机画面,随后交给同一套图像条件策略。
模型看到的仍是一张图,但图里多了与物体空间位置对齐的接触线索。这样,原本已经会关注夹爪和目标物体的视觉网络,也能把“在哪里碰到、力朝哪个方向”纳入动作判断。团队还设计了由现成部件制造的磁接触传感器,并公布参数化CAD到模具的制作流程。
四项实机任务检验接触价值
论文把方法用于推、插、对齐等接触密集任务。仅看画面时,机器人可能知道夹爪靠近了目标,却无法确认是否真正贴住、是否卡在边缘。加上接触覆盖层后,同一策略能利用这些反馈修正动作,而无需更改模型主架构。
论文项目图:四类真实机器人任务覆盖不同的接触、插入和对齐场景。
结果显示,在LIBERO的双视角设置中,BC-Transformer平均提高15.7个百分点;miniVLA在LIBERO上平均提高25个百分点。最醒目的数字来自真实机器人:π0.5配合这套传感器,在四项接触密集任务上平均提高30个百分点。不同模型都受益,说明关键不只是哪一种策略,而是触觉被送进模型的方式。
提升不是来自多看一台相机
团队还比较了单视角、双视角以及不同触觉呈现方式。结果强调,简单增加一幅独立触觉图并不等于模型会有效使用;把信号放回场景的同一空间框架,才让预训练视觉特征更容易建立“物体—夹爪—接触”的关系。
论文项目图:BC-Transformer在LIBERO多套任务上的成功率对比。
需要注意,论文中的30个百分点是平均差值,来自四项特定真实任务。传感器耐用性、长期漂移、更多物体材质,以及高速操作中的延迟,还需要更广泛测试。
下一步是让触觉成为通用视觉提示
这条路线的现实价值在于接入成本低:仓储、装配和服务机器人可以先保留已有视觉策略,再把接触信息作为画面提示加入。如果同一种表示能跨传感器、夹爪和机器人本体稳定工作,触觉就有机会像深度图一样成为通用输入,而不是每换一套硬件就重新训练一套大脑。
参考资料
https://arxiv.org/abs/2609.14156