Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化
机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) ; School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院) ; School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) ; AI Center, OPPO, China(OPPO人工智能中心) ; Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)
AI总结 本文提出AVUR-LLM,通过稀疏模态对齐和视觉单元引导细化,提升音频视觉语音识别的鲁棒性,在LRS3数据集上取得显著性能提升。
Comments submitted to Interspeech 2026