模型同时收到视频、音频、图片和文字,文字若与其他证据冲突,它常直接跟着文字回答。微软研究院印度分院与IIIT Hyderabad推出C3PO基准,最佳模型准确率73.17%,人类为88.64%。
C3PO含3404个样本,用25类逻辑模板生成。题目一类要求把分散在不同模态的信息拼起来,另一类刻意放入矛盾,检查模型能否判断哪项证据应当优先。
同样四种输入,证据角色决定难度
基准按模态组合和推理层级组织成四层。配对设计让研究者只改变证据之间的关系,观察模型在信息组合与反事实冲突中的差异。最大模型不一定稳:Qwen3-Omni总分43.98%,四选一任务中一些开源模型接近随机水平。
论文图4:多数模型中,回答正确的样本在中间层保持了更高的跨模态注意力熵。
同等复杂度模板之间出现56个百分点差距。差异并非简单由“用了几种模态”解释,而是音频、图像或文字在冲突中承担什么逻辑角色。
失败样本多数被单一模态接管
注意力探针显示,86%至95%的失败与模态主导有关。Qwen系列和Phi-4等模型把90%至95%的注意力预算给文字,忽略音频或图像中的反证;较均衡的模型会给非文本证据更多权重。
论文图5:部分模型形成明显的文字主导分配,另一些模型对非文本模态分配更多注意力。
研究还发现,中间层保持较高注意力熵的样本更容易答对。模型若过早把注意力收缩到一种模态,后层很难重新找回被忽略的证据。这是相关性诊断,不等同于已经证明注意力分配就是全部因果机制。
论文图6:单一模态主导在多数模板中构成主要错误来源。
自动模板让诊断清楚,也限制现实外推
模板化数据便于控制变量和追踪失败,但真实会议、视频客服与机器人环境中的噪声更复杂。API模型只运行一次,开源模型结果则取三次平均,比较仍受采样和版本影响。
C3PO证明“能接收多模态”不能自动推出“会核对多模态”。产品端若要处理证据冲突,还需在真实任务中测音频缺失、字幕错误、画面欺骗与时间不同步,而非只报告综合准确率。