AVT2-DWF: Improving Deepfake Detection with Audio-Visual Fusion and Dynamic Weighting Strategies
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted to EMNLP 2023 Findings
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments ICCV 2023
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments DAGM GCPR 2023
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by IEEE International Workshop on Machine Learning for Signal Processing (MLSP 2022)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 10 pages, 5 Figures, Neurips 2021
Journal ref https://nips.cc/Conferences/2021
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments A version of this work has been accepted to Interspeech 2021
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Baseline Paper MuSe 2020, MuSe Workshop Challenge, ACM Multimedia
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments ICCV 2019
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.AI
Comments Accepted at IEEE IJCNN 2018, Rio de Janeiro, Brazil
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI、cs.MM
Comments Baseline paper for the 4th Multimodal Sentiment Analysis Challenge (MuSe) 2023, a workshop at ACM Multimedia 2023
Ex-Omni-2D:具备原生视觉存在的高表达全模态对话模型
专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 Ex-Omni-2D是一种全模态对话框架,可生成含文本、个性化语音与参考条件视频的协同响应,通过特定机制实现高效增量生成,在指定分辨率下达成1.293的端到端RTF,提供实用的质量效率平衡点。
超越文本:探索K-12教育工作者对利用多模态大语言模型学习机会的视角和想法
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 研究通过工作坊探讨K-12教育工作者对多模态大语言模型在教育中的应用看法,分析其面临的挑战与需求,提出两种用户导向的实施方法。
在大型视听检索模型中解锁空间定位
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 研究针对视听声源定位任务,利用大规模视听检索模型的潜在表示,引入LAIP框架,通过音频信息池化恢复局部空间信息,在相关数据集上取得领先性能,证明可从现有检索表示解锁定位,为检索和定位任务提供统一路径。
通过强大的音频感知增强长格式全模态理解
机构 * SAI, Shanghai Jiao Tong University(上海交通大学 上海人工智能研究院) ; Zhejiang University(浙江大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);audio-visual(abstract)
AI总结 为解决全模态理解不足问题,提出AVDC数据集及AVDC-QA-CoT数据集,利用现成模型标注视频,采用两阶段训练范式,在多下游任务实验中取得显著性能提升,推动全模态感知发展。
跨域音视频欺骗检测基准测试
机构 * Rapid-Rich Object Search (ROSE) Lab and the College of Computing and Data Science, Nanyang Technological University (NTU)(快速丰富对象搜索(ROSE)实验室和南洋理工大学计算与数据科学学院) ; School of Computing and Information Technology and Dongguan Key Laboratory for Intelligence and Information Technology, Great Bay University(计算与信息科技学院和东莞智能与信息技术重点实验室,大湾大学) ; DSO National Laboratories(国防科学实验室) ; College of Computing and Data Science, Nanyang Technological University (NTU)(计算与数据科学学院,南洋理工大学) ; SMBU, Shenzhen 518172, China(深圳SMBU,越南河内VinUniversity,和新加坡NTU) ; VinUniversity, Hanoi 100000, Vietnam ; and NTU, Singapore
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
AI总结 提出首个跨域音视频欺骗检测基准,评估不同场景下的泛化能力,并设计MM-IDGM算法和Attention-Mixer融合方法提升性能。
Comments 17 pages
从感知到决策:多模态大语言模型中听觉与视觉感知的信息流
机构 * Surrey Institute for People-Centred AI (PAI)(萨里人本人工智能研究所) ; University of Surrey(萨里大学) ; Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究多模态大语言模型(AVLLMs)中音频和视觉信息流的路径与整合机制,发现顺序流与并行流两种路由模式,并证明信息传递后可丢弃无关token以提升效率。
Comments 40 pages, 29 figures
ImmersiveTTS:基于多模态扩散Transformer和领域特定表示对齐的环境感知文本转语音
机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 提出ImmersiveTTS模型,通过多模态扩散Transformer和领域特定表示对齐,实现与环境音频自然融合的文本到语音生成。
Comments Accepted to ACL 2026 main conference. Code is available at https://github.com/jjunak-yun/ImmersiveTTS
使用Cornstarch高效分布式多模态大语言模型训练
专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract)
AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。
Comments ICML'26
Omni-DeepSearch:一种基于音频的多模态深度搜索基准
机构 * CASIA ; UCAS ; BAAI ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract)
AI总结 本文提出Omni-DeepSearch基准,用于评估基于音频的多模态深度搜索能力,通过多跳推理生成客观答案,结果显示该任务极具挑战性。
Comments 43 pages
Audio-Omni: 扩展多模态理解到多功能音频生成与编辑
机构 * Hong Kong University of Science and Technology(香港理工大学) ; WeChat Vision, Tencent Inc(微信视觉,腾讯公司) ; Peking University(北京大学)
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。
统一的跨模态评分图像、符号音乐和表演音频翻译
机构 * Department of Artificial Intelligence, Sogang University(西江大学人工智能系) ; Sogang Future Lab, Sogang University(西江大学未来实验室) ; Department of Physics Education, Seoul National University(首尔大学物理教育系) ; Computer Science Department, Carnegie Mellon University(卡内基梅隆大学计算机科学系) ; Department of Art & Technology, Sogang University(西江大学艺术与技术系)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、eess.AS
AI总结 本文提出统一模型,通过大规模数据集和模态分词实现多模态翻译,提升光学音乐识别的符号错误率至13.67%并实现评分图像条件音频生成。
Comments Submitted to IEEE Transactions on Audio, Speech and Language Processing (TASLPRO)
Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 34, pp. 1876-1891, 2026
层次化语义相关性感知的掩码自编码器用于无监督音频-视觉表示学习
机构 * KDDI Research, Inc., Saitama, Japan(KDDI研究所,埼玉,日本)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出HSC-MAE框架,通过三级表示层次强制语义一致性,结合教师-学生架构和多任务学习,提升无监督音频-视觉表示学习效果。
Comments 6 pages, 2 tables, 4 figures. Accepted by IEEE ICME 2026
驯服持续音频-视觉分割中的模态纠缠
机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) ; MAIS, Institute of Automation(自动化研究所MAIS) ; School of Intelligent Science and Technology, University of Science and Technolog Beijing(智能科学与技术学院,北京理工大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出CAVS任务和CMR框架,通过解决多模态语义漂移和共现混淆问题,提升持续音频-视觉分割性能。
Crab$^{+}$: 一种可扩展且统一的音频视觉场景理解模型,具有显式合作
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) ; Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院) ; AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频业务单元AI技术中心) ; Hefei University of Technology(合肥工业大学) ; The University of Hong Kong(香港大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 Crab$^{+}$通过显式合作解决音频视觉任务异质性问题,实现更广泛的任务覆盖和优于单任务模型的性能表现。
多模态大语言模型的不确定性量化:基于不一致性调整的语义体积
机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 UMPIRE是一种无需训练的多模态大语言模型不确定性量化框架,通过内部特征有效捕捉语义多样性和响应不一致性,提升错误检测和不确定性校准性能。
Comments Earlier versions presented at ICLR 2025 QUESTION workshop and ICML 2025 R2-FM workshop
基于云的跨模态Transformer用于情绪识别和自适应人机交互
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、eess.AS
AI总结 本文提出基于云的跨模态Transformer框架,通过整合多模态信号提升情绪识别的鲁棒性和泛化能力,实现高效、实时的自适应人机交互。
DefenSee:从视觉和文本中解构威胁——一种多视图防御管道用于多模态对抗突破
专题命中 音频语音多模态 :multi-modal(title,abstract);MLLM(abstract);cross-modal(abstract)
AI总结 DefenSee通过图像变体转录和跨模态一致性检查,提供一种多模态防御方法,有效降低多模态对抗攻击的成功率,提升模型鲁棒性。
它能听,也能看 too:通过将视觉理解整合到音频语言模型中构建多模态大语言模型以检测抑郁症
机构 * Monash University(墨尔本大学) ; Massachusetts Institute of Technology(麻省理工学院) ; The University of Melbourne(墨尔本大学)
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
AI总结 本文提出了一种多模态大语言模型框架,通过整合视觉理解到音频语言模型中,提升抑郁症检测的准确性与效率。