Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
关注式AV融合网络:基于混合注意力的音频-视觉质量预测
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS
AI总结 本文提出一种结合学习音频特征和手工设计视频特征的混合注意力模型,用于提升音频-视觉质量预测的准确性和鲁棒性。
Comments Accepted to 51st IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 04-08 May 2026