arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

上海科技大学让机器人提前预演触觉,插接和剥离也能生成训练轨迹

作者:arXivDaily编辑部 arXiv 2607.22530 cs · cs.RO

机械臂把物体插进狭窄接口时,相机可能看不到接触点,真正决定成败的是压力、摩擦和细微位移。上海科技大学、InstAdapt团队提出ViTacWorld,让世界模型根据机器人动作同时预测未来画面和触觉反馈,再用生成轨迹扩充插接、剥离等任务的训练数据。

这套方法结合公开真实触觉数据、仿真交互和真实机器人策略轨迹。它不是用视频“猜感觉”的演示,而是把视觉、触觉与动作按时间对齐,生成可供策略训练和评估的视触觉rollout。

视觉和触觉在同一条时间线上预测

ViTacWorld把相机画面和触觉传感器读数编码成潜在Token,再由带视角感知的扩散Transformer根据动作序列预测后续观察。模型输出两条同步流:机器人接下来会看到什么,以及接触面会感受到什么。

论文Figure 1:真实与仿真数据用于预训练,真实策略轨迹用于目标域微调,模型生成视触觉rollout。

团队先用公开真实触觉数据和自建仿真环境扩大覆盖面,再用真实策略执行数据微调。触觉信号与局部接触几何直接相关,某些情况下比整幅视觉画面的仿真差距更小,但材料摩擦、柔性物体和传感器形变仍难完全模拟。

模型先预演,再给策略补课

输入第一帧和后续动作后,ViTacWorld可以连续预测视觉与触觉变化。项目页给出的验证片段包含模型预测和真实记录,重点不是生成一段好看的视频,而是让接触位置和触觉变化与动作保持一致。

项目Figure 3:模型根据首帧和动作序列,预测后续视觉画面与触觉观察。

生成轨迹随后被加入专家示范数据,训练同一结构的触觉策略。这样可以在不反复磨损真实触觉传感器的情况下,增加策略见过的对齐、接触调整和失败恢复变化。

同一策略,增加生成数据后再对比

论文用相同策略结构做对照:一组只看专家示范,另一组加入ViTacWorld生成的rollout。定性序列显示,加入生成数据的策略在拾取、对齐和接触修正上更稳定。

论文Figure 2:上行为只用专家示范的策略,下行为加入ViTacWorld生成数据后的执行结果。

更多实机案例覆盖不同接触密集任务。图片能够说明作者展示的执行差异,但单个案例不能替代统计结果;改进幅度仍取决于任务、传感器、真实微调数据和仿真质量。

世界模型生成的数据是否有用,最终要由下游策略而不是画面观感判断。一段预测视频即使看起来流畅,只要触觉峰值出现得太早、接触位置偏移或失败恢复不真实,就可能教给策略错误动作。论文把视觉和触觉一起评估,正是为了避免只凭“视频像不像”判断轨迹质量。

生成轨迹也没有替代真实示范。团队先用真实与仿真数据学习交互规律,再把合成rollout混入专家数据训练策略;真实微调仍承担校准传感器与环境差异的作用。更准确的理解是减少部分采集压力,而不是机器人今后可以完全不接触实物就学会操作。

因此,衡量收益时应同时查看成功率、失败类型和真实数据用量,而不能只比较生成帧数。若合成数据大量重复容易状态,训练规模变大也未必提升真实任务;真正有价值的是覆盖原示范缺少的接触变化,并且没有引入新的错误模式。

论文Figure 5:不同任务中,专家数据策略与生成数据增强策略的实机执行序列。

下一步要处理传感器和物体差异

ViTacWorld把世界模型从纯视觉扩展到接触反馈,适合插接、擦拭、剥离和柔性物体操作等相机容易受遮挡的场景。它也可以在真实执行前比较多个动作序列的预测结果,作为策略评估工具。

要跨平台使用,还需要解决触觉硬件规格、安装位置和材料响应差异。不同传感器的图像式触觉表示并不天然兼容,仿真接触模型也会产生偏差。后续关键是建立更统一的触觉接口,并验证生成数据在更长任务和更多真实物体上的收益。

参考资料

https://arxiv.org/abs/2607.22530

https://arxiv.org/html/2607.22530

https://vitacworld.github.io/