arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-23 至 2026-01-23 共收录 1 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 1 篇

2509.16994 2026-01-23 eess.AS cs.MM eess.IV 84%

Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention

关注式AV融合网络:基于混合注意力的音频-视觉质量预测

Ina Salaj, Arijit Biswas

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 本文提出一种结合学习音频特征和手工设计视频特征的混合注意力模型,用于提升音频-视觉质量预测的准确性和鲁棒性。

Comments Accepted to 51st IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 04-08 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏