arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

微软&港理工等让视频AI先想结局,四分之一训练步数超基线

作者:arXivDaily编辑部 arXiv 2610.03664 cs · cs.CV

论文导读

微软、香港理工大学、加州大学戴维斯分校等机构提出ProAR,让持续生成视频的模型同时预想最终画面和下一步状态。VBVR十项任务中,平均成绩从0.663升到0.801;训练2500步时就超过训练10000步的标准基线。视频生成开始按目标和规则推进,排序、拼图等过程可以逐步检查。

画面顺滑,不保证拼图能拼完

按类型和大小排序图形,或者移动滑块拼出目标,需要每一步符合规则,也要最终完成任务。只让视频模型根据历史画面接着生成,局部变化可以很自然,整段过程却可能偏离目标。

ProAR在持续生成过程中加入一个不断更新的目标画面判断,让模型同时考虑终点。当前片段能够读取目标信息,而目标判断不会被同一步的带噪当前画面扰乱。

推理时,模型自己预测这个目标画面,并没有提前拿到正确的未来帧。训练时使用最终正确画面进行监督,不能把训练条件误写成测试时直接提供答案。

图:视觉任务、迷宫连线与双手模拟操作的生成过程对照。

终点要对,中间也得按规则走

另一个机制让当前状态更接近下一段应有的内部表示。训练时,正确的后续片段已经可用,团队利用它指导模型提前理解即将发生的变化。

这一辅助预测器只在训练中存在,推理时会移除。它与最终目标指导分工不同:前者帮助下一步转换合理,后者避免整段视频走偏。论文比较了单独使用和组合使用的表现。

系统仍建立在Wan2.2视频骨干上,通过改造持续生成和训练流程完成这些任务。它没有把视觉推理改成文字解题,而是直接让生成的画面呈现过程与结果。

图:历史、当前和目标视频流与未来表示指导的模型流程。

2500步超过基线,成绩限于所测任务

VBVR实验从100类任务中选出十项,包含排序、图形匹配、多米诺、管道和滑块拼图等。每项扩展到50个测试样本,总计500个,最终平均成绩为0.801,标准持续生成基线为0.663。

ProAR训练2500步时约为0.708,已经超过标准基线训练10000步的约0.663。这是训练步数四分之一,不能直接说总GPU花费减少75%,因为每步计算和训练流程仍需单独计量。

十项中八项优于标准基线,并非所有任务都提升。另在迷宫、连线和推箱子的VideoRLVR评测中,平均成功率从50.97提高到52.97,平均精确率从61.56升到67.17,两项指标不能互换。

图:ProAR与标准基线在不同训练步数上的平均成绩曲线。

下一步:把目标约束带进具身模拟

项目演示展示了任务起点、连续生成过程和最后结果,能看到生成是否遵守规则。WorldArena扩展还测试了50种双手操作任务,考察视频序列能否作为具身模拟的可行动过程。

这些结果支持继续研究带目标的视觉预测,并不等于机器人实机已经获得同样成功率。后续可在更多任务、更长步骤和复杂物体交互中验证,分开衡量目标完成、中间过程正确以及运行开销。

参考资料

https://arxiv.org/abs/2610.03664

https://arxiv.org/html/2610.03664

https://luka-group.github.io/ProAR/

↑