An Analysis of Speech Enhancement and Recognition Losses in Limited Resources Multi-talker Single Channel Audio-Visual ASR
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、eess.AS
Comments 14 pages, 4 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments 34 pages, 11 figures, Submitted to Information Fusion
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to Interspeech 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS
Comments 13 Pages
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted for publication at Interspeech 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to Interspeech 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to ICASSP 2019
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI
Comments Inaccurate scientific facts listed in document
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS
Journal ref in 2019 International Workshop on Multilayer Music Representation and Processing, Milano, IEEE 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :audio-visual(title);multi-modal(abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、eess.AS
Comments IROS 2018 Workshop on Crossmodal Learning for Intelligent Robotics
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、eess.AS
Comments Accepted to NIPS 2018. v2 added the majority word baseline results and other minor fixes. arXiv admin note: text overlap with arXiv:1710.04087 by other authors
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to SIGGRAPH 2018. Project webpage: https://looking-to-listen.github.io
Journal ref ACM Trans. Graph. 37(4): 112:1-112:11 (2018)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、eess.AS
Comments 5 Pages, 1 Figure, accepted at INTERSPEECH 2018
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments Under review on Journal of Artificial Intelligence Research (JAIR) -- Special Track on Deep Learning, Knowledge Representation, and Reasoning
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM
Comments Accepted in CICLing 2017
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments 10 pages, data and models available at http://www.cs.cornell.edu/~jhessel/cats/cats.html, Proceedings of WWW 2017
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM
Comments Accepted as Journal Publication in IEEE Intelligent Systems
Journal ref IEEE Intelligent Systems 31.6 (2016): 82-88
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI
Comments 7 pages, 8 figures
Journal ref Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Lausanne, Switzerland, IEEE publications, pp. 1082-1089 (2002)
ISCSLP 2026 真实场景视听语音增强挑战赛
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
AI总结 该研究介绍ISCSLP 2026真实场景视听语音增强挑战赛,设置含真实混合、合成重混等赛道,公布基线结果与相关资源,以评估视听语音增强在自然场景下的性能。
Comments The First Real-World Audio-Visual Speech Enhancement (AVSE) Challenge
现实世界人机交互(HRI)中的多模态融洽度估计
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 本研究针对现实世界人机交互的融洽度估计问题,采用日本药店的62个多模态会话,对比零样本LLMs等模型,发现Gemini融合模型表现最优,且性能随互动时长、群体规模变化。
Comments 9 pages, 4 figures, 3 tables. Accepted at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)
机构 * Fudan University(复旦大学) ; Shanghai University of Finance and Economics(上海财经大学) ; ByteDance Inc(字节跳动公司)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Comments Project Page: https://github.com/henghuiding/Awesome-Multimodal-Referring-Segmentation