Towards Multimodal Emotion Recognition in German Speech Events in Cars using Transfer Learning
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL、eess.AS
Comments 12 pages, 2 figures, accepted at KONVENS 2019
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL、eess.AS
Comments 12 pages, 2 figures, accepted at KONVENS 2019
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CL、eess.AS
Comments Accepted to Interspeech 2019. 4 pages, 2 figures
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :multi-modal(title);分类 cs.CL、eess.AS
Comments 5 pages, 5 tables, 1 figure
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.AI
Journal ref 25th International Conference on MultiMedia Modeling (MMM2019)
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、eess.AS
Comments Accepted for Interspeech 2018, 5 pages, 4 figures
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL、eess.AS
Comments Accepted for Interspeech 2018, India
专题命中 音频语音多模态 :multimodal(title);分类 cs.CL、eess.AS
Comments 5 pages, 5 figures, Accepted at IEEE International Conference on Acoustics, Speech and Signal Processing 2018 (ICASSP 2018)
专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.CL
Comments Data Mining (ICDM), 2017 IEEE 17th International Conference on
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.CL
DASH:动态音频驱动的语义分块以实现高效的多模态令牌压缩
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tongji University(同济大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 DASH通过动态音频驱动的语义分块方法,有效压缩多模态令牌,提升推理效率,优于传统固定窗口分块和注意力剪枝方法。
Comments ECCV 2026
UniSonate:一种统一的语音、音乐和音效生成模型,通过文本指令控制
机构 * Tianjin University(天津大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 UniSonate通过统一的文本指令接口生成语音、音乐和音效,采用动态令牌注入机制和多阶段课程学习策略,提升跨模态生成性能,实现指令驱动的TTS和TTM的SOTA表现。
Comments Accepted to ACL 2026 main conference (oral)
AudioX:一种用于任意到音频生成的统一框架
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Independent Researcher(独立研究者)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
AI总结 本文提出AudioX框架,整合多种模态条件,通过多模态自适应融合模块提升生成质量,并构建大规模高质量数据集IF-caps,验证了其在文本到音频和文本到音乐生成中的优越性能。
Comments Accepted to ICLR 2026
LAV:基于神经压缩和StyleGAN2的音频驱动动态视觉生成
机构 * Dept. of Artificial Intelligence(人工智能系) ; Dept. of Art & Technology(艺术与技术系)
专题命中 音频语音多模态 :audio-visual(abstract,abstract_cn);分类 cs.AI、cs.MM、eess.AS
AI总结 LAV结合EnCodec神经音频压缩与StyleGAN2生成能力,通过随机初始化线性映射将音频嵌入转换为StyleGAN2的风格潜在空间,实现语义丰富的音频-视觉转换。
Comments Paper accepted at ISEA 2025, The 30th International Symposium on Electronic/Emerging Art, Seoul, Republic of Korea, 23 - 29 May 2025
Journal ref Proceedings of the International Symposium on Electronic/Emerging Art: 2025, Seoul, Republic of Korea / no., 2025, pp.1129-1132
多感官智能的愿景:感知、科学与协同
机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出未来十年多感官人工智能的研究愿景,强调通过感知、科学和协同三大主题推动多感官技术发展,提升人与AI的交互体验。
机构 * KAIST, South Korea(韩国釜山国立大学) ; NWPU, China(中国西北工业大学) ; UNIST, South Korea(韩国全南国立大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS
Comments accepted by NeurIPS 2025
机构 * University of Catania(卡塔尼亚大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments accepted to ACM Multimedia Asia 2025
机构 * University of Edinburgh(爱丁堡大学) ; Instituto de Telecomunicações(电信研究所) ; Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院) ; Unbabel
专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Pre-print
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 17 pages, 12 figures, source code available at https://github.com/wguo86/SSV2A
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; KAIST EE(韩国科学技术院电子工程系)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to ICCV 2025
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments ICML 2025
机构 * Dartmouth College(达特茅斯学院) ; Yale University(耶鲁大学)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted to the main conference of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)
机构 * Imperial College London(伦敦帝国学院) ; Meta AI ; Fondazione Bruno Kessler(布鲁诺·克塞尔基金会)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Interspeech 2025
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments 21 pages, 6 figures, 15 tables
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted at EMNLP 2024
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments Project Page: https://freeze-omni.github.io/
专题命中 音频语音多模态 :multi-modal(abstract);omni-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Working in progress
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Submitted to ICASSP 2025. Project page https://v-aura.notion.site