arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Adobe等让AI给生成视频查物理错误,304条缺陷解释了228条

作者:arXivDaily编辑部 arXiv 2609.03153 cs · cs.CV

论文导读

Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等机构提出VeriPhy,逐条检查生成视频违反了哪项物理要求、错误出现在何时。149段核心视频含304条人工缺陷,它解释了228条,对比评测器为164条;同骨干直接提示也达到222条,主要增量是证据链可审计。

一个总分说不清视频哪里违背物理

生成视频可能画面流畅,却让篮球穿过地面、物体数量突然变化,或在碰撞前就改变速度。普通质量分只能说明“看起来不对”,很难指出违反了哪条要求、发生在哪一帧,也无法区分证据不足和明确错误。

VeriPhy先让纯文本规划器把提示词拆成可检查的物理义务,例如物体必须保持数量、碰撞前后轨迹应连续。规划在看到视频前完成,并通过静态检查,防止模型看完画面后临时改题。

图:论文源码中的篮球落地案例是VeriPhy检查碰撞与轨迹的可视对象。

低层工具只执行事先声明的测量

执行阶段可以调用分割、跟踪、计数、深度、OCR、音频事件和11类物理测量,但每次调用都受原计划限制。工具返回的记录带来源、时间范围和测量类型;无法可靠使用时标为未知,不强行给出真假结论。

固定解析器把证据合成为支持、矛盾或未知三种状态,对外显示为合理、不合理或弃权。审计者能够从最终判定一路返回具体轨迹、深度图或音频事件,而不是只看到模型生成的一段解释。

图:篮球与墙体场景用于展示空间位置、接触时刻和运动变化的检查对象。

304条标注中覆盖228条

团队先整理1500段带人工缺陷定位的视频,再从中形成149段核心集,共有304条可定位到提示、空间和时间的缺陷记录。VeriPhy解释其中228条,使用相同视频和声明的问题分解评测器解释164条。

同一骨干模型直接整体提示达到222条,和228条相差不大。论文没有把优势包装成纯召回碾压:VeriPhy多出的价值是每次决定都保存测量与来源,且遇到无法判断的情况可以弃权。系统表现仍依赖分割、跟踪和深度工具的可靠性。

图:论文源码中的生成帧为篮球案例提供逐帧视觉证据。

下一步把可审计判定接回生成过程

当前工作先解决评测:把“哪里不对”变成结构化证据。后续可以把矛盾记录写回视频生成过程,只重采样出错时段,或针对计数、碰撞和支撑关系设置不同修正器。

真正进入自动后训练前,还要测量错误工具对最终奖励的影响。若跟踪器丢失物体,系统可能把观测失败当成物理失败;三值状态能减少误判,但不能消除上游视觉工具的偏差。新测试还应覆盖液体、软体和多物体连续碰撞,观察固定测量类型能否处理更复杂的物理关系。

参考资料

https://arxiv.org/abs/2609.03153