How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning
视觉如何转化为语言:多模态推理的逐层信息论分析
机构 * Duke kunshan University, Duke University(杜克昆山大学、杜克大学) ; The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) ; Fudan University, Shanghai, China(复旦大学)
AI总结 本研究通过逐层信息论分析揭示多模态Transformer中视觉信息如何转化为语言,发现视觉独特信息早期峰值,语言独特信息在晚期层主导预测,跨模态协同较低,且任务依赖性强。