视频世界模型离开一个场景再返回时,如果新画面与第一次访问高度相似,常被解释为“记住了”。阿里巴巴、同济大学、上海交通大学提出R2M-Bench,指出模型只要几乎不移动,也能得到漂亮的绝对相似度。
R2M-Bench为每次返回同时寻找两组对照:时间间隔相近但没有返回的长间隔帧,以及相邻时刻的短间隔帧。基准由100个参考场景、三种离开—返回轨迹组成300个实例,共评测7个动作条件视频模型。
高相似度可能只是画面没怎么动
绝对返回分数比较第一次访问帧和返回帧。若模型生成的视频整体运动缓慢、背景重复或动作执行失败,两帧自然相似,却不能证明模型在远离后恢复了场景内容。相反,一个真实移动较多的模型可能因为视角变化而得分更低。
论文把问题改成同一段视频内部的相对比较:返回帧是否比普通长间隔帧保留了更多第一次访问的信息,再用短间隔帧估计这段视频本身能达到的局部一致性上限。
图1:低运动可抬高原始相似度,R2M-Bench用返回、长间隔和短间隔三组帧进行校准。
三条轨迹覆盖直返、转向与闭环
基准包含原路返回、平移后转向返回以及绕一圈回到起点三种模板。系统根据动作轨迹检测首次访问与返回位置,再在同一生成序列中匹配时间跨度相近的非返回对照。
每个实例都评估外观保真、场景身份、物体身份、局部几何和持久状态。指标MemoryGain衡量返回相对长间隔基线的优势,NMR再用短间隔与长间隔之间的动态范围归一化,让不同模型的渲染稳定性更可比。
图2:三条轨迹分别测试原路返回、转向返回和闭环返回,颜色表示时间推进。
同一段视频里的三组帧各有作用
返回对检查模型是否恢复先前场景,长间隔非返回对测量一般时间稳定性,短间隔对提供局部一致性参考。三者必须来自同一条生成轨迹,才能减少提示词、场景难度和渲染风格带来的差异。
定性案例中,有些模型的返回帧看起来很像起点,但普通长间隔帧也同样相似,说明高分主要来自变化不足。另一些模型经历明显运动后仍恢复了物体与布局,相对指标会给出更高记忆增益。
图3:每行依次展示返回对、时间跨度匹配的非返回对和短间隔参考对。
NMR与人工判断相关系数达到0.547
七个模型的总体NMR与人工一致性判断的Spearman相关系数为0.547,95%置信区间为0.45至0.63。NMR与生成运动量的模型内相关幅度为0.072,低于原始返回相似度的0.207,说明相对校准削弱了“少动更高分”的捷径。
图4:人工评审从场景、物体、几何和状态等维度比较返回一致性。
0.547仍是中等相关,不能把指标当成人工判断的替代品。它更适合筛查和横向比较,模型若出现新型运动失败或画面复制行为,仍需回看片段确认。
扩展到可交互世界模型评测
代码已公开,下一步可以把相对校准加入更长路线、更多动作类型和带物体状态变化的交互任务。若模型打开抽屉、移动物体后离开,再返回时既要记住场景,也要保持操作后的状态,评测会更接近游戏和机器人应用。
部署侧还应同时记录动作完成度。一个画面记忆稳定、却无法按指令移动的模型不适合作为可控世界模拟器;把轨迹执行、视觉质量和返回记忆并列报告,才能避免单一指标再次形成新捷径。
相对指标也依赖轨迹中存在足够运动。如果整段视频完全静止,短间隔和长间隔参照会失去区分度。基准在报告NMR时因此需要同时给出有效返回数量、运动幅度和被过滤样本,防止模型通过不执行动作规避测试。