Multimodal Transformer Distillation for Audio-Visual Synchronization
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted by ICASSP 2024
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted by ICASSP 2024
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.AI
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM
Comments 5 pages, 3 figures, 15 references
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);分类 cs.MM、eess.AS
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM
Comments Under review at OJSP
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.AI、cs.MM
Comments 9 pages, 5 figures, 3 tables, accepted by IEEE ISM 2022
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.MM、eess.AS
Comments This paper is the same as arXiv:1703.10893v6. Apologies for the inconvenience. arXiv admin note: text overlap with arXiv:1703.10893
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments ICLR 2022
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Work accepted at Interspeech 2021
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments CVPR 2021. The first two authors contributed equally to this work. Project page: https://caffnet.github.io
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments CVPR 2021
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to ICASSP 2021
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title);cross-modal(abstract);分类 cs.CV、eess.AS
Comments Accepted in WACV 2021
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);MLLM(abstract)
Comments Accepted for publication at ICASSP 2025. The code and checkpoints are available here: https://github.com/umbertocappellazzo/Llama-AVSR
基于同步感知跨模态稀疏注意力的高效视听生成
机构 * Alibaba Group(阿里巴巴集团) ; Alibaba Cloud Computing(阿里巴巴云计算) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV
AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。
多模态基础模型中的测试时扩展:生成与推理的综合调查
机构 * Sun Yat-sen University(中山大学)
专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV
AI总结 本文首次系统综述多模态基础模型中的测试时扩展(TTS)方法,提出统一分类框架(采样、反馈、搜索三类),总结应用与基准,并讨论未来方向。
Comments Accepted by ACL 2026, Findings
先分后融:通过模态特定的推理链减轻音频视觉大语言模型中的跨模态干扰
机构 * Tianjin Key Laboratory of Cognitive Computing(天津认知计算实验室) ; Tianjin University(天津大学) ; Huiyan Technology Company, Ltd.(慧颜科技有限公司) ; Chinese Academy of Sciences(中国科学院) ; Tencent(腾讯)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.AI
AI总结 本文提出SFFL框架,通过模态特定的推理链减少跨模态干扰,提升音频视觉问答的准确性和鲁棒性,实验显示在通用AVQA基准和跨模态幻觉基准上分别提升5.16%和11.17%。
MAViD:一种多模态框架用于音频-视觉对话理解和生成
机构 * Tsinghua University(清华大学) ; Meituan(美团)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV
AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。
CAE-AV:通过跨模态交互增强改进音频-视觉学习
机构 * School of Information Science and Engineering, East China University of Science and Technology (ECUST)(信息科学与工程学院,东华大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV
AI总结 CAE-AV通过跨模态交互增强框架,解决音频-视觉学习中的模态不对齐问题,提升表示质量和任务性能。
Comments 13 pages, 8 figures
跨模态瓶颈融合用于噪声鲁棒的音频视觉语音识别
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 eess.AS
AI总结 CoBRA通过跨模态瓶颈融合机制,在噪声环境下提升音频视觉语音识别的鲁棒性和效率。
Comments 5 pages, 3 figures, ICASSP 2026 Accepted
从对比到共同性:用于增强多模态大语言模型中音频-文本跨模态理解的音频共同性描述
机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 eess.AS
AI总结 本文提出音频共同性描述方法,旨在增强多模态大语言模型中音频与文本的跨模态理解,通过捕捉音频片段间的共享语义以改善模型的泛化能力与任务特定性能。
MAVERIX:多模态音频视觉评估与识别指数
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV、cs.AI、cs.MM
AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。
Journal ref AAAI 2026
ERF-BA-TFD+: 一种用于音频视觉深度伪造检测的多模态模型
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.AI
AI总结 ERF-BA-TFD+通过结合增强接收场和音频视觉融合,提出了一种多模态深度伪造检测模型,在DDL-AV数据集上实现了最先进的检测性能。
Comments The paper is withdrawn after discovering a flaw in the theoretical derivation presented in Section Method. The incorrect step leads to conclusions that are not supported by the corrected derivation. We plan to reconstruct the argument and will release an updated version once the issue is fully resolved
机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)
专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CL
Comments arxiv
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.MM
Comments 8 pages, 10 figures
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Palermo(巴勒莫大学) ; iFLYTEK Research(iFLYTEK研究院)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.MM
Comments 13 pages, 8 figures
机构 * University of Surrey(塞拉利昂大学)
专题命中 音频语音多模态 :multi-modal(title);audio-visual(title);multimodal(abstract);cross-modal(abstract)