论文导读
中科院自动化所、智源研究院、西安交通大学和亚马逊提出DIDO,把多步视频世界动作模型压缩成一次去噪。它在LIBERO平均成功率达到99.0%,LIBERO-Plus为76.6%,RoboTwin为92.0%;99%是仿真基准成绩,真实机器人部分主要验证迁移能力。
机器人等不起一段慢慢变清的视频
世界动作模型会根据当前画面和动作,生成接下来可能出现的视觉变化。它能帮助机器人预判“抓住后会怎样”,但扩散视频模型通常要迭代多次去噪。闭环控制每一步都要等待预测,几十次迭代叠加后,延迟会直接拖慢动作。
论文图:DIDO把教师模型的多步去噪动态蒸馏到单次前向传播。
简单截断只做第一步并不可靠。作者观察到,墙面、桌面等静态背景很早就成形,真正决定操作的夹爪和目标物体却仍模糊。后续去噪不只是补纹理,还逐步补出“手如何碰到物体”的交互动态。
蒸馏时专门盯住夹爪和物体
DIDO先用分布匹配蒸馏,让单步学生接近多步教师的输出。随后加入带监督的边界框视觉推理标记,显式指出夹爪、被操作物体和二者交互的位置;它还把多个模型层中的目标物体表示与预训练DINOv3特征对齐。
论文图:静态结构较早稳定,夹爪与物体的交互信息在后续步骤才逐渐清晰。
这些约束的目的不是让每个像素都更漂亮,而是把有限的一次计算优先留给会改变动作决策的区域。模型因此能在一步内同时保留场景、实体和未来交互,而不是得到一张背景清楚、机械臂却糊掉的预测图。
三套基准与真实机械臂一起测
论文在不同难度的机器人操作集上评估:LIBERO平均成功率99.0%,更强调环境变化的LIBERO-Plus为76.6%,RoboTwin为92.0%。这些数字说明单步并未必然牺牲控制成功率,也揭示更复杂泛化场景仍明显更难。
论文图:DIDO在真实机械臂上的长时程操作与泛化任务示例。
真实机器人实验展示了向长时程任务和新条件迁移的可行性,但规模与仿真基准不同。论文没有证明所有开放环境都能达到99%,也不能把生成预测的提速直接换算成整套机器人的同等提速。
从结果分布看,常规位置变化比加入大量视觉干扰更容易,后者仍会明显拉低成功率。这提醒开发者,单步预测解决的是延迟与交互信息保留,并没有同时消除环境泛化难题。
下一步是把一步预测接进更快闭环
对仓储、桌面操作和家庭机器人而言,世界模型只有快到能跟上控制频率,才真正有用。接下来需要测试视觉遮挡、物体失手、连续失败恢复和更长动作链,并把相机、模型、规划器的总延迟一起测量。若交互区域蒸馏能跨机器人复用,它可能成为视频世界模型走出离线演示的关键步骤。
参考资料
https://arxiv.org/abs/2609.15570