PMMTalk: Speech-Driven 3D Facial Animation from Complementary Pseudo Multi-modal Features
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);audio-visual(abstract)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);audio-visual(abstract)
非对称层次锚定用于音频-视觉联合表示:解决信息分配模糊性以实现鲁棒跨模态泛化
机构 * Zhejiang University, China(浙江大学) ; University of California, Berkeley, USA(加州大学伯克利分校) ; MMLab, Chinese University of Hong Kong, China(香港中文大学MMLab)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract)
AI总结 本文提出非对称层次锚定框架,通过结构化语义锚点解决跨模态泛化中的信息分配模糊性,提升语义一致性和表示纯度。
机构 * Institute of Image Communication ; Network Engineering, Shanghai Key Laboratory of Digital Media Processing ; Transmissions, Shanghai Jiao Tong University, Shanghai ; School of Communication \& Electronic Engineering, East China Normal University, Shanghai
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.CV、cs.MM、eess.AS
Comments Paper Accepted by ICASSP2023
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV、cs.CL、cs.MM
Comments Presented as a short-paper at the 23rd Workshop on the Semantics and Pragmatics of Dialogue (SemDial 2019 - LondonLogue), Sep 4-6, 2019, London, UK
Journal ref Proceedings of the 23rd Workshop on the Semantics and Pragmatics of Dialogue (SEMDIAL), pp. 213-215, London, United Kingdom, September 2019
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract)
Comments 6 pages, MMML workshop at NIPS 2015
OmniFysics:通过多模态信号处理和网络优化实现物理智能进化
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Fysics AI
专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);audio-visual(abstract)
AI总结 OmniFysics通过统一图像、音频、视频和文本的多模态信号处理,结合动态物理数据引擎和物理知识注入,实现网络化AI系统的自主优化,提升物理理解能力。
Comments This work has been submitted to the IEEE for possible publication
EgoAVU:第一人称音频视觉理解
机构 * Meta ; University of Maryland, College Park(马里兰大学College Park分校)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)
AI总结 EgoAVU通过生成第一人称音频视觉叙述和问题,提升多模态大语言模型在第一人称视频理解中的性能。
分段后审计:用于语言指代音频视频分段的无参考掩码质量评估
机构 * MBZUAI ; National University of Singapore(国立新加坡大学) ; Fudan University(复旦大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本研究提出 MQA-RefAVS 任务,通过多模态大语言模型评估语言指代音频视频分段中掩码质量,提升分割准确性与可解释性。
TAViS: 基于文本的音频视觉分割与基础模型
机构 * Northwestern Polytechnical University(西北工业大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)
AI总结 TAViS通过文本桥接机制结合多模态基础模型与分割模型,实现高效的音频视觉分割与跨模态对齐。
Comments ICCV2025,code:https://github.com/Sssssuperior/TAViS
某些模态比其他模态更平等:在MLLMs中解码和架构多模态整合
机构 * Boston University(波士顿大学) ; Google DeepMind(谷歌DeepMind)
专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);audio-visual(abstract)
AI总结 本文研究了多模态大语言模型对矛盾模态的鲁棒性,提出模态对齐调优策略以提升多模态推理能力。
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);MLLM(abstract);cross-modal(abstract)
Comments Project page: https://github.com/DianJin-HFUT/SimToken
机构 * School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机科学学院) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);image-text(abstract)
Comments Submitted to the Journal on February 6, 2024
SCoPE:基于稀疏跨模态先验交换的无训练视听事件感知
机构 * KAIST(韩国科学技术院)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.CV、cs.MM
AI总结 针对无训练视听事件感知的虚假共激活问题,提出SCoPE框架,通过跨模态标签竞争消除FCA,在LLP等数据集上显著提升性能且可直接迁移。
Comments 17 pages, 6 figures
从单模态、跨模态和多模态视角综述音乐生成
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心)
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(title);分类 cs.AI、cs.MM
AI总结 本文综述了多模态音乐生成的研究现状,探讨了多模态数据对齐、系统评估方法及未来研究方向。
量化多模态不平衡:一种基于GMM的自适应损失用于音频-视觉学习
机构 * South China University of Technology(南方科技大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.AI、eess.AS
AI总结 本文提出基于GMM的自适应损失,用于量化和缓解多模态学习中的样本级不平衡问题,通过双阶段框架提升音频-视觉学习性能。
机构 * New Turing Institute(新图灵研究所) ; Phenikaa University(费尼卡大学) ; Vietnam Institute of Information Technology(越南信息技术研究所) ; VietAI Research(越南人工智能研究)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(title);分类 cs.CV、cs.CL
Comments Accepted at Interspeech 2025
专题命中 音频语音多模态 :multi-modal(title);MLLM(title);multimodal(abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.MM、eess.AS
Comments 13 pages, IJCAI-2024
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.CV、eess.AS
Comments This paper has been received by ACM MM 23
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(title);分类 cs.CL、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV、eess.AS
Comments 7 pages, 4 figures, 4 tables
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title);分类 cs.CV、eess.AS
Comments Preprint. Work in progress
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 eess.AS;multi-modal(comments)
Comments 13 pages, accepted by IEEE JSTSP Special Issue on Deep Learning for Multi-modal Intelligence across Speech, Language, Vision, and Heterogeneous Signals