arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频模型假装懂物理?清华微软ECCV揭秘:准确率差1%但思考逻辑全错

作者:arXivDaily编辑部 arXiv 2609.22788 cs · cs.CV · stat · stat.AP

论文导读

视频大模型在画面生成中展现了逼真的动态效果,但其是否真正理解客观物理世界的运动法则始终存在广泛争议。清华大学联合面壁智能与微软等机构在ECCV深入揭示了视频基础模型在物理因果推理中的表面化捷径缺陷。评测表明模型表面准确率虽仅与人类相差1%,但内部决策分歧率高达26.4%,暴露出深层的常识认知漏洞。

核心背景与世界模型假象

当前视频生成与自监督视频表征模型凭借庞大的参数规模,已经能够逼真模拟各种流体泼洒、物体形变与激烈碰撞的复杂视觉奇观。许多研究者据此推断大模型已经自主衍生出了内生的一致性世界物理模型,但清华大学、面壁智能与微软的研究团队联合开展的最新体检却给出了令人冷静的反向实证。研究发现,模型在许多宏观物理选择题上的高正确率,很大程度上只是利用了画面低阶纹理的统计相关性走捷径,并未真正建立起坚固的物理因果链条。

研究团队选取了V-JEPA2与VideoMAE等顶尖视频基础模型,针对刚体碰撞、多米诺骨牌连锁反应、布料形变悬挂与重物自由下落等八类经典物理实验展开系统性探查。通过精确测量模型隐层表征在不同物理变量扰动下的响应熵值,评测套件将题目划分为人类易解但模型困惑、以及模型自以为正确但违反常识的多个交叉象限。

图:模型盲区与人类困难象限在物理熵值空间中的显著偏离分布

多维任务矩阵与因果探针设计

对比统计揭示了一个惊人的反差现象:在总体的粗粒度预测准确率上,先进视频模型与普通成年人类受试者的差距仅有微弱的1.0个百分点。然而在逐题对齐的决策置信度矩阵中,模型与人类给出的推理路径分歧率却高达26.4%,属于典型的做对答案却用错定理。在涉及摩擦阻尼与多体连环碰撞的精细测试中,模型经常将视觉运动平滑度误判为物理因果成立,一旦背景光影发生轻微扰动便会给出截然相反的结论。

图:视频基础模型在刚体碰撞自由落体与布料形变等任务上的体检得分

关键突破与因果偏差透视

这一关键发现深刻敲响了将现有视频模型直接迁移至具身机械臂规划与工业高精仿真领域的安全警钟。如果仅仅依赖表面视频生成的感官真实感而忽略底层物理常识的严格对齐,自主智能体在真实物理世界中便极易诱发致命的操控失误。

图:不同视频生成模型在因果物理测试题上的置信度与错误集中区间

未来应用与落地展望

研究团队为此倡导将可微分物理引擎与符号因果逻辑深度融入下一代视频基础模型的预训练架构中。未来的研究方向将致力于构建物理常识内嵌的可信世界模型,推动多模态智能体由纯视觉像素生成真正走向理性的物理因果推演。

参考资料

https://arxiv.org/abs/2609.22788

https://arxiv.org/abs/2609.22788