Do You Really Mean That? Content Driven Audio-Visual Deepfake Dataset and Multimodal Method for Temporal Forgery Localization
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV
Comments DICTA 2022
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV
Comments DICTA 2022
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV
Comments 8 pages, 4 figures
ControlFoley: 一种统一且可控的视频到音频生成方法,具有跨模态冲突处理
机构 * MiLM Plus, Xiaomi Inc.(小米MiLM Plus) ; MiLM Plus, Xiaomi Inc. Wuhan University(小米MiLM Plus 武汉大学) ; Wuhan University(武汉大学)
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
AI总结 ControlFoley通过联合视觉编码和时域-音域解耦提升视频到音频生成的可控性与同步性,在多种任务中表现优异。
从说话到唱歌:音视频深度伪造检测的新挑战
机构 * Center for Future Media, School of Computer Science and Engineering, University of Electronic Science and Technology of China(未来媒体中心,计算机科学与工程学院,电子科技大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM
AI总结 针对现有音视频深度伪造检测方法在唱歌场景中性能下降的问题,提出文本引导的音视频伪造检测框架(T-AVFD),通过面部真实性模式学习和多模态差异权重学习,在说话和唱歌场景中均实现鲁棒检测。
Comments Accepted by ICML 2026
面向全模态大语言模型(Omni-LLMs)的基于局部视听动态的延迟音频剪枝方法
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.AI、cs.MM
AI总结 针对全模态大语言模型的高开销问题,提出两阶段框架A-PACK,利用局部视听动态延迟音频剪枝,在Qwen2.5-Omni基准上实现性能最优,同时大幅降低预填充开销并提升解码吞吐量。
视听火烈鸟:用于长而复杂视频的开放视听智能
机构 * NVIDIA, USA(美国NVIDIA公司) ; University of Maryland, USA(美国马里兰大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、eess.AS
AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。
Comments Project Page: https://avflamingo.pages.dev/
AV-JEPA:将LeJEPA扩展到视听自监督学习
机构 * ELLIS Institute Finland(芬兰ELLIS研究所) ; Department of Computer Science, Aalto University, Espoo, Finland(艾尔沃斯大学计算机科学系)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM
AI总结 研究将LeJEPA扩展到视听自监督学习,核心方法是用早期融合视觉Transformer和模态丢弃作掩码训练模型对齐视图嵌入,主要贡献是实现跨模态对齐,架构简洁,在分类任务中有竞争力且支持零样本音频-视频检索。
EAR:增强单模表示以实现弱监督音频视觉视频解析
机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学) ; State Grid Corporation of China(国家电网公司) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出EAR框架,通过增强伪标签生成器和AVVP模型的单模表示,提升视频解析的时序定位性能。
AVRT:通过单模态教师模型实现音频-视觉推理迁移
机构 * University of Tübingen, Germany(图宾根大学) ; MIT, Cambridge MA, USA(麻省理工学院) ; IBM Research, USA(IBM研究院) ; MIT-IBM Watson AI Lab, USA(麻省理工-IBM沃森人工智能实验室) ; Tuebingen AI Center, Germany(图宾根人工智能中心)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出AVRT框架,通过单模态教师模型生成高质量音频-视觉推理轨迹,并利用LLM合并模型整合轨迹,从而在多模态设置中实现推理迁移,取得音视频和音频任务的最优效果。
OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进
机构 * ARC Lab, Tencent(腾讯ARC实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。
Comments Project Page: https://arcomniscript.github.io
MSCT:深度伪造检测中的差分跨模态注意力
机构 * Beijing Institute of Technology(北京理工大学) ; China Academy of Electronics and Information Technology(中国电子信息技术研究院)
专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
AI总结 本文提出MSCT模型,通过多尺度自注意力和差分跨模态注意力提升深度伪造检测性能,实验验证其在FakeAVCeleb数据集上的有效性。
Comments Accpeted by ICASSP2026
团队RAS在第10届ABAW竞赛中的表现:多模态valence和arousal估计方法
机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡联邦研究中心) ; ITMO University(ITMO大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种多模态方法,用于在真实环境中估计valence和arousal。结合面部、行为和音频模态,利用GRADA、Transformer、Qwen3-VL-4B-Instruct和Mamba等技术,实现跨模态融合,最终在Aff-Wild2数据集上达到0.658的CCC值。
Comments 8 pages, 1 figure
OmniForcing:释放实时联合音频视觉生成
机构 * JD Explore Academy(京东探索学院) ; Fudan University(复旦大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出OmniForcing框架,通过因果蒸馏将双向扩散模型转化为高保真流式自回归生成器,解决双流架构中的训练不稳定问题,实现25FPS的实时生成性能。
Comments 14 pages
你能持续地听、定位和分割吗?面向音频视频分割的无示例持续学习基准
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、eess.AS
AI总结 本文提出无示例持续学习基准和ATLAS模型,通过低秩锚定缓解灾难性遗忘,验证了在动态环境下音频视频分割的持续学习能力。
面向可泛化的深度伪造检测的伪造感知音频视觉适应:一种变分贝叶斯方法
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Department of New Networks, Pengcheng Laboratory(鹏城实验室网络部) ; School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院) ; School of Computer Science and Cyber Engineering, Guangzhou University(广州大学计算机科学与网络工程学院) ; School of Cyberspace Science, Harbin Institute of Technology(哈尔滨工业大学网络空间科学学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出基于变分贝叶斯的伪造感知音频视觉适应方法,通过估计音频视觉相关性来提升深度伪造检测的泛化能力。
Comments TIFS AQE
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
Comments 25 pages, 9 figures
机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) ; No. 59 Middle School of Urumqi(乌鲁木齐市第五十九中学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Main paper (8 pages). Accepted for publication by ECAI( European Conference on Artificial Intelligence) 2025
机构 * University of Groningen, The Netherlands(Groningen大学,荷兰)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CL、cs.MM
专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments This work has been submitted to the IEEE for possible publication
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
Comments Accepted by ACM MM 24
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR2021
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted to DICTA 2019
专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
Comments 6 pages, 3 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract,comments);cross-modal(abstract);分类 cs.CV
Comments 8 Page, 2 Figures, 2 Tables, Accepted in Adapting to Change: Reliable Multimodal Learning Across Domains Workshop, ECML PKDD 2023