Audio-Visual Speech Enhancement for Spatial Audio - Spatial-VisualVoice and the MAVE Database
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
机构 * National Taiwan University(国立台湾大学) ; NVIDIA
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Submitted to ICASSP 2026
机构 * Imperial College London(伦敦帝国学院) ; University of Manchester(曼彻斯特大学) ; HiThink Research(HiThink研究院) ; Soochow University(苏州大学) ; Hong Kong Baptist University(香港 Baptist大学) ; Idiap Research Institute(Idiap研究 institute) ; Meta AI ; Fudan University(复旦大学)
专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Project: https://github.com/HiThink-Research/NEXUS-O
机构 * Social Cognitive Systems Group, Bielefeld University(比勒菲尔德大学社会认知系统小组)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV