论文导读
腾讯混元、复旦大学、上海人工智能实验室等机构提出WorldReward,把世界模型的镜头动作执行和画面质量交给同一个奖励模型判断。它在760对人工标注视频上,三项偏好一致性分别比GPT-5.5高3.42、1.45和3.56个百分点;结果来自特定相机控制模型与受控后训练,不能替代开放场景的视频质量评测。
长视频里的错误常只出现几帧
相机控制世界模型要同时满足两件事:用户按下前进、转向等指令后,画面必须发生对应变化;生成过程还要保持结构、外观和运动连贯。几何轨迹奖励只看相机走没走对,逐帧图像奖励又容易漏掉闪烁、漂移和动态断裂。把整段视频与全部动作一次交给视觉语言模型,局部证据还会被长上下文稀释。
WorldReward把成对视频按连续四个动作切成小块。每块包含源图、两段视频的起中末帧和逐动作首尾对照,模型先判断每个动作,再对各块投票,分别输出动作一致性与画面质量偏好。
图:论文图1把成对视频按动作切块,并用源图、帧网格和动作首尾帧组成证据。
训练数据先由模型判断,再让工具和人复核
团队收集八种世界模型在相同图像、描述和相机轨迹下生成的成对视频。Gemini 3.1 Pro先写结构化判断,使用工具的GPT-5.5智能体再按需放大帧、检查争议动作,最后由人工抽查修改记录。论文报告,智能体提出的修订中87.0%获得人工确认。
这套流程没有把大模型判断当作天然真值。每条训练记录都保留局部画面、动作方向、偏好结论和修改来源,训练时能追到一项偏好由哪段证据产生。
图:论文图4比较基础HY-WorldPlay 1.5与使用WorldReward后训练的同场景结果。
760对视频上三项都超过直接评审
WorldReward-Bench包含760对共享源图、描述和轨迹的生成视频,人工分别标注动作一致性、外观质量和运动质量。论文报告WorldReward在三项上相对GPT-5.5分别高3.42、1.45和3.56个百分点,也超过Gemini 3.1 Pro及若干专用奖励模型。
把它用于HY-WorldPlay 1.5强化学习后训练时,人类与模型评审都更偏好新模型的动作执行和视觉质量。这里比较的是固定来源模型、轨迹与成对协议,不能推成对任意视频生成器的统一排名。
图:论文图6展示200对人工研究样本中的动作一致性与视觉质量胜率。
图:项目页基准图展示视频来源、场景类别和视觉风格分布。
下一步是把可追溯奖励接回生成过程
当前系统给出成对偏好,适合为后训练选择更好的生成结果。进一步工作可把某个动作块的失败原因直接写回采样或修正过程,让模型只重做出错区间,并扩大到物体交互、角色动作等更复杂控制。
部署前还要在未参与数据构建的新模型、长轨迹和真人评审上重复测试。若奖励模型只适应现有生成器的常见瑕疵,训练可能优化评分而非真实动作正确性。