论文导读
复旦大学、新加坡国立大学和腾讯团队提出一套MiniMax-H3跨模态物理推理评测,包含517个样例。模型要把文字、图像、声音和前缀视频中的不完整线索拼在一起,最终总体成功率41.97%;其中视频决策推理最高为56.00%,音频消歧最低仅27.40%。这套新评测不等于模型全部能力排名。
会同时生成声音和画面,不代表真正理解两者关系
全模态模型把文本、图像、视频和音频放进统一框架,看起来天然更接近“世界模型”。但传统视频生成评测常让提示词直接描述目标画面,模型只需复现内容,难以检验它是否能利用不同模态的互补线索推断事件状态和下一步变化。
图1:评测要求模型整合多种输入模态,而非只按文字生成画面。
新框架刻意把证据拆开:单一模态只能提供部分信息,正确结果必须联合推理。例如静态图像给出场景,声音暴露物体或动作;前缀视频展示运动趋势,文本则隐藏或间接表达后续事件。模型如果只抓住最显眼的一种输入,就会生成语义顺畅却不符合物理过程的结果。
517个样例覆盖四类互补线索任务
四类场景包括隐式提示配多帧图像、音频—图像、前缀视频和音频—视频输入。数据中的内容从体育、烹饪到日常物体和游戏,目的不是测单一知识点,而是观察模型能否把跨模态证据合成一个一致的未来。
图2:数据集包含体育、食物、家居、游戏和自然场景。
这类评测比画质打分更苛刻。生成视频即使清晰,如果轮胎没有压碎杯子、拼图步骤违反操作约束,或动物动作与前缀不连贯,仍会被判为推理失败。它关注的是事件因果和物理一致性,而不是单帧是否逼真。
下一步:从统一生成走向统一理解
MiniMax-H3在517个实例上的总体成功率为41.97%。视频决策推理表现最高,达到56.00%;音频消歧只有27.40%,说明声音中的关键线索尚未稳定影响生成结果。论文展示的失败包括滑板运动、轮胎压杯、魔方还原和动物行为等,画面有时合理,却违背输入暗示的真实后果。
图3:生成结果在物理规律或细粒度操作上出现不一致。
41.97%不能解释成MiniMax-H3“只懂四成物理世界”:任务是论文新构建的,样例规模、判定标准和生成随机性都会影响结果,也没有覆盖模型的全部应用。它更像一张诊断表,指出统一模态接口并不会自动带来统一推理。下一步需要模型更可靠地对齐声音、图像与时间变化,并用可重复的多次生成评估稳定性。评测也应扩展到更长因果链、反事实变化和真实传感器噪声,避免模型仅凭数据集中的表面线索猜中结果。
还应报告多次采样方差,区分偶然生成正确与稳定推理正确。
参考资料
https://arxiv.org/abs/2609.18323