arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

能看能听却不会交叉核对:全模态模型把最多95%注意力给了文字

arXiv 2608.05381 cs.AI

模型同时收到视频、音频、图片和文字,文字若与其他证据冲突,它常直接跟着文字回答。微软研究院印度分院与IIIT Hyderabad推出C3PO基准,最佳模型准确率73.17%,人类为88.64%。

C3PO含3404个样本,用25类逻辑模板生成。题目一类要求把分散在不同模态的信息拼起来,另一类刻意放入矛盾,检查模型能否判断哪项证据应当优先。

同样四种输入,证据角色决定难度

基准按模态组合和推理层级组织成四层。配对设计让研究者只改变证据之间的关系,观察模型在信息组合与反事实冲突中的差异。最大模型不一定稳:Qwen3-Omni总分43.98%,四选一任务中一些开源模型接近随机水平。

正确与错误样本的跨模态熵差异

论文图4:多数模型中,回答正确的样本在中间层保持了更高的跨模态注意力熵。

同等复杂度模板之间出现56个百分点差距。差异并非简单由“用了几种模态”解释,而是音频、图像或文字在冲突中承担什么逻辑角色。

失败样本多数被单一模态接管

注意力探针显示,86%至95%的失败与模态主导有关。Qwen系列和Phi-4等模型把90%至95%的注意力预算给文字,忽略音频或图像中的反证;较均衡的模型会给非文本证据更多权重。

各模态平均注意力预算

论文图5:部分模型形成明显的文字主导分配,另一些模型对非文本模态分配更多注意力。

研究还发现,中间层保持较高注意力熵的样本更容易答对。模型若过早把注意力收缩到一种模态,后层很难重新找回被忽略的证据。这是相关性诊断,不等同于已经证明注意力分配就是全部因果机制。

不同模板的失败类型

论文图6:单一模态主导在多数模板中构成主要错误来源。

自动模板让诊断清楚,也限制现实外推

模板化数据便于控制变量和追踪失败,但真实会议、视频客服与机器人环境中的噪声更复杂。API模型只运行一次,开源模型结果则取三次平均,比较仍受采样和版本影响。

C3PO证明“能接收多模态”不能自动推出“会核对多模态”。产品端若要处理证据冲突,还需在真实任务中测音频缺失、字幕错误、画面欺骗与时间不同步,而非只报告综合准确率。

参考资料

https://arxiv.org/abs/2608.05381