Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
利用大语言模型缓解音频视觉语音识别中的注意力下沉和大规模激活
机构 * University of British Columbia, Canada(不列颠哥伦比亚大学) ; Imperial College London, UK(伦敦帝国学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS
AI总结 本文提出了一种简单有效的去相关损失,通过减少BOS与其它token的余弦相似性,缓解音频视觉语音识别中的注意力下沉和大规模激活问题,同时在高下采样率下降低词错误率。
Comments IEEE ICASSP 2026. The code is available at https://github.com/umbertocappellazzo/Llama-AVSR