Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict
音频-视觉大型语言模型中的组合式失效:跨模态冲突下的深层先验主导
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究针对AV-LLMs,以音频-视觉冲突为组合泛化测试,发现模型存在先验主导的组合式失效,开展可解释性分析并验证时间对齐无法提升冲突解决能力,提供了相关代码与数据。
Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026. 7 pages, 4 figures