Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Meta AI Research(Meta AI 研究)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV、cs.MM
Comments EMNLP 2025 (Findings)