Multimodal Emotion Recognition using Audio-Video Transformer Fusion with Cross Attention
基于音频-视频Transformer融合与交叉注意力的多模态情感识别
机构 * School of Computer Science and Engineering, Vellore Institute of Technology (VIT) University(计算机科学与工程学院,维洛雷理工学院(VIT大学))
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本文提出AVT-CA模型,通过音频-视频Transformer融合与交叉注意力机制,提升多模态情感识别的准确率和F1分数。