arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯混元给世界模型装上双重裁判,三项指标超过GPT-5.5

作者:arXivDaily编辑部 arXiv 2609.03952 cs · cs.CV

论文导读

腾讯混元、复旦大学、上海人工智能实验室等机构提出WorldReward,把世界模型的镜头动作执行和画面质量交给同一个奖励模型判断。它在760对人工标注视频上,三项偏好一致性分别比GPT-5.5高3.42、1.45和3.56个百分点;结果来自特定相机控制模型与受控后训练,不能替代开放场景的视频质量评测。

长视频里的错误常只出现几帧

相机控制世界模型要同时满足两件事:用户按下前进、转向等指令后,画面必须发生对应变化;生成过程还要保持结构、外观和运动连贯。几何轨迹奖励只看相机走没走对,逐帧图像奖励又容易漏掉闪烁、漂移和动态断裂。把整段视频与全部动作一次交给视觉语言模型,局部证据还会被长上下文稀释。

WorldReward把成对视频按连续四个动作切成小块。每块包含源图、两段视频的起中末帧和逐动作首尾对照,模型先判断每个动作,再对各块投票,分别输出动作一致性与画面质量偏好。

图:论文图1把成对视频按动作切块,并用源图、帧网格和动作首尾帧组成证据。

训练数据先由模型判断,再让工具和人复核

团队收集八种世界模型在相同图像、描述和相机轨迹下生成的成对视频。Gemini 3.1 Pro先写结构化判断,使用工具的GPT-5.5智能体再按需放大帧、检查争议动作,最后由人工抽查修改记录。论文报告,智能体提出的修订中87.0%获得人工确认。

这套流程没有把大模型判断当作天然真值。每条训练记录都保留局部画面、动作方向、偏好结论和修改来源,训练时能追到一项偏好由哪段证据产生。

图:论文图4比较基础HY-WorldPlay 1.5与使用WorldReward后训练的同场景结果。

760对视频上三项都超过直接评审

WorldReward-Bench包含760对共享源图、描述和轨迹的生成视频,人工分别标注动作一致性、外观质量和运动质量。论文报告WorldReward在三项上相对GPT-5.5分别高3.42、1.45和3.56个百分点,也超过Gemini 3.1 Pro及若干专用奖励模型。

把它用于HY-WorldPlay 1.5强化学习后训练时,人类与模型评审都更偏好新模型的动作执行和视觉质量。这里比较的是固定来源模型、轨迹与成对协议,不能推成对任意视频生成器的统一排名。

图:论文图6展示200对人工研究样本中的动作一致性与视觉质量胜率。

图:项目页基准图展示视频来源、场景类别和视觉风格分布。

下一步是把可追溯奖励接回生成过程

当前系统给出成对偏好,适合为后训练选择更好的生成结果。进一步工作可把某个动作块的失败原因直接写回采样或修正过程,让模型只重做出错区间,并扩大到物体交互、角色动作等更复杂控制。

部署前还要在未参与数据构建的新模型、长轨迹和真人评审上重复测试。若奖励模型只适应现有生成器的常见瑕疵,训练可能优化评分而非真实动作正确性。

参考资料

https://arxiv.org/abs/2609.03952

https://codegoat24.github.io/WorldReward/