arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里等提出R2M-Bench:慢镜头不再冒充世界模型“记住了”

作者:arXivDaily编辑部 arXiv 2608.27328 cs · cs.CV

视频世界模型离开一个场景再返回时,如果新画面与第一次访问高度相似,常被解释为“记住了”。阿里巴巴、同济大学、上海交通大学提出R2M-Bench,指出模型只要几乎不移动,也能得到漂亮的绝对相似度。

R2M-Bench为每次返回同时寻找两组对照:时间间隔相近但没有返回的长间隔帧,以及相邻时刻的短间隔帧。基准由100个参考场景、三种离开—返回轨迹组成300个实例,共评测7个动作条件视频模型。

高相似度可能只是画面没怎么动

绝对返回分数比较第一次访问帧和返回帧。若模型生成的视频整体运动缓慢、背景重复或动作执行失败,两帧自然相似,却不能证明模型在远离后恢复了场景内容。相反,一个真实移动较多的模型可能因为视角变化而得分更低。

论文把问题改成同一段视频内部的相对比较:返回帧是否比普通长间隔帧保留了更多第一次访问的信息,再用短间隔帧估计这段视频本身能达到的局部一致性上限。

图1:低运动可抬高原始相似度,R2M-Bench用返回、长间隔和短间隔三组帧进行校准。

三条轨迹覆盖直返、转向与闭环

基准包含原路返回、平移后转向返回以及绕一圈回到起点三种模板。系统根据动作轨迹检测首次访问与返回位置,再在同一生成序列中匹配时间跨度相近的非返回对照。

每个实例都评估外观保真、场景身份、物体身份、局部几何和持久状态。指标MemoryGain衡量返回相对长间隔基线的优势,NMR再用短间隔与长间隔之间的动态范围归一化,让不同模型的渲染稳定性更可比。

图2:三条轨迹分别测试原路返回、转向返回和闭环返回,颜色表示时间推进。

同一段视频里的三组帧各有作用

返回对检查模型是否恢复先前场景,长间隔非返回对测量一般时间稳定性,短间隔对提供局部一致性参考。三者必须来自同一条生成轨迹,才能减少提示词、场景难度和渲染风格带来的差异。

定性案例中,有些模型的返回帧看起来很像起点,但普通长间隔帧也同样相似,说明高分主要来自变化不足。另一些模型经历明显运动后仍恢复了物体与布局,相对指标会给出更高记忆增益。

图3:每行依次展示返回对、时间跨度匹配的非返回对和短间隔参考对。

NMR与人工判断相关系数达到0.547

七个模型的总体NMR与人工一致性判断的Spearman相关系数为0.547,95%置信区间为0.45至0.63。NMR与生成运动量的模型内相关幅度为0.072,低于原始返回相似度的0.207,说明相对校准削弱了“少动更高分”的捷径。

图4:人工评审从场景、物体、几何和状态等维度比较返回一致性。

0.547仍是中等相关,不能把指标当成人工判断的替代品。它更适合筛查和横向比较,模型若出现新型运动失败或画面复制行为,仍需回看片段确认。

扩展到可交互世界模型评测

代码已公开,下一步可以把相对校准加入更长路线、更多动作类型和带物体状态变化的交互任务。若模型打开抽屉、移动物体后离开,再返回时既要记住场景,也要保持操作后的状态,评测会更接近游戏和机器人应用。

部署侧还应同时记录动作完成度。一个画面记忆稳定、却无法按指令移动的模型不适合作为可控世界模拟器;把轨迹执行、视觉质量和返回记忆并列报告,才能避免单一指标再次形成新捷径。

相对指标也依赖轨迹中存在足够运动。如果整段视频完全静止,短间隔和长间隔参照会失去区分度。基准在报告NMR时因此需要同时给出有效返回数量、运动幅度和被过滤样本,防止模型通过不执行动作规避测试。

参考资料

https://arxiv.org/abs/2608.27328

https://github.com/AMAP-ML/R2MBench