Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
机构 * 1Laboratory of Cognitive Computing ; Application, College of Intelligence ; Computing, Tianjin University, Tianjin, China 2School of Computer Science, Shanghai Jiao Tong University, Shanghai, China 3School of Electrical \& Electronic Engineering, Nanyang Technological University, Singapore 4Huiyan Technology (Tianjin) Co., Ltd, Tianjin, China
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.MM
Comments Submitted to ICASSP 2026