机械臂把物体插进狭窄接口时,相机可能看不到接触点,真正决定成败的是压力、摩擦和细微位移。上海科技大学、InstAdapt团队提出ViTacWorld,让世界模型根据机器人动作同时预测未来画面和触觉反馈,再用生成轨迹扩充插接、剥离等任务的训练数据。
这套方法结合公开真实触觉数据、仿真交互和真实机器人策略轨迹。它不是用视频“猜感觉”的演示,而是把视觉、触觉与动作按时间对齐,生成可供策略训练和评估的视触觉rollout。
视觉和触觉在同一条时间线上预测
ViTacWorld把相机画面和触觉传感器读数编码成潜在Token,再由带视角感知的扩散Transformer根据动作序列预测后续观察。模型输出两条同步流:机器人接下来会看到什么,以及接触面会感受到什么。
论文Figure 1:真实与仿真数据用于预训练,真实策略轨迹用于目标域微调,模型生成视触觉rollout。
团队先用公开真实触觉数据和自建仿真环境扩大覆盖面,再用真实策略执行数据微调。触觉信号与局部接触几何直接相关,某些情况下比整幅视觉画面的仿真差距更小,但材料摩擦、柔性物体和传感器形变仍难完全模拟。
模型先预演,再给策略补课
输入第一帧和后续动作后,ViTacWorld可以连续预测视觉与触觉变化。项目页给出的验证片段包含模型预测和真实记录,重点不是生成一段好看的视频,而是让接触位置和触觉变化与动作保持一致。
项目Figure 3:模型根据首帧和动作序列,预测后续视觉画面与触觉观察。
生成轨迹随后被加入专家示范数据,训练同一结构的触觉策略。这样可以在不反复磨损真实触觉传感器的情况下,增加策略见过的对齐、接触调整和失败恢复变化。
同一策略,增加生成数据后再对比
论文用相同策略结构做对照:一组只看专家示范,另一组加入ViTacWorld生成的rollout。定性序列显示,加入生成数据的策略在拾取、对齐和接触修正上更稳定。
论文Figure 2:上行为只用专家示范的策略,下行为加入ViTacWorld生成数据后的执行结果。
更多实机案例覆盖不同接触密集任务。图片能够说明作者展示的执行差异,但单个案例不能替代统计结果;改进幅度仍取决于任务、传感器、真实微调数据和仿真质量。
世界模型生成的数据是否有用,最终要由下游策略而不是画面观感判断。一段预测视频即使看起来流畅,只要触觉峰值出现得太早、接触位置偏移或失败恢复不真实,就可能教给策略错误动作。论文把视觉和触觉一起评估,正是为了避免只凭“视频像不像”判断轨迹质量。
生成轨迹也没有替代真实示范。团队先用真实与仿真数据学习交互规律,再把合成rollout混入专家数据训练策略;真实微调仍承担校准传感器与环境差异的作用。更准确的理解是减少部分采集压力,而不是机器人今后可以完全不接触实物就学会操作。
因此,衡量收益时应同时查看成功率、失败类型和真实数据用量,而不能只比较生成帧数。若合成数据大量重复容易状态,训练规模变大也未必提升真实任务;真正有价值的是覆盖原示范缺少的接触变化,并且没有引入新的错误模式。
论文Figure 5:不同任务中,专家数据策略与生成数据增强策略的实机执行序列。
下一步要处理传感器和物体差异
ViTacWorld把世界模型从纯视觉扩展到接触反馈,适合插接、擦拭、剥离和柔性物体操作等相机容易受遮挡的场景。它也可以在真实执行前比较多个动作序列的预测结果,作为策略评估工具。
要跨平台使用,还需要解决触觉硬件规格、安装位置和材料响应差异。不同传感器的图像式触觉表示并不天然兼容,仿真接触模型也会产生偏差。后续关键是建立更统一的触觉接口,并验证生成数据在更长任务和更多真实物体上的收益。
参考资料
https://arxiv.org/abs/2607.22530