arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4567 篇

2204.06228 2023-05-25 cs.CV 86%

Do You Really Mean That? Content Driven Audio-Visual Deepfake Dataset and Multimodal Method for Temporal Forgery Localization

Zhixi Cai, Kalin Stefanov, Abhinav Dhall, Munawar Hayat

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV

Comments DICTA 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.04224 2017-03-20 cs.CV 86%

Auxiliary Multimodal LSTM for Audio-visual Speech Recognition and Lipreading

Chunlin Tian, Weijun Ji

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15086 2026-08-14 cs.MM cs.CV cs.SD 版本更新 86%

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

ControlFoley: 一种统一且可控的视频到音频生成方法,具有跨模态冲突处理

Jianxuan Yang, Xinyue Guo, Zhi Cheng, Kai Wang, Lipan Zhang, Jinjie Hu, Qiang Ji, Yihua Cao, Yihao Meng, Zhaoyue Cui, Mengmei Liu, Meng Meng, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米MiLM Plus) MiLM Plus, Xiaomi Inc. Wuhan University(小米MiLM Plus 武汉大学) Wuhan University(武汉大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 ControlFoley通过联合视觉编码和时域-音域解耦提升视频到音频生成的可控性与同步性,在多种任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27944 2026-08-12 cs.AI cs.MM cs.SD 版本更新 86%

From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection

从说话到唱歌:音视频深度伪造检测的新挑战

Ke Liu, Jiwei Wei, Wenyu Zhang, Shuchang Zhou, Ruikun Chai, Yutao Dai, Chaoning Zhang, Yang Yang

机构 * Center for Future Media, School of Computer Science and Engineering, University of Electronic Science and Technology of China(未来媒体中心,计算机科学与工程学院,电子科技大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 针对现有音视频深度伪造检测方法在唱歌场景中性能下降的问题,提出文本引导的音视频伪造检测框架(T-AVFD),通过面部真实性模式学习和多模态差异权重学习,在说话和唱歌场景中均实现鲁棒检测。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08794 2026-08-11 cs.AI cs.MM cs.SD 新提交 86%

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

面向全模态大语言模型(Omni-LLMs)的基于局部视听动态的延迟音频剪枝方法

Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim, Sungeun Hong

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.AI、cs.MM

AI总结 针对全模态大语言模型的高开销问题,提出两阶段框架A-PACK,利用局部视听动态延迟音频剪枝,在Qwen2.5-Omni基准上实现性能最优,同时大幅降低预填充开销并提升解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16107 2026-07-20 eess.AS cs.CV 新提交 86%

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

视听火烈鸟:用于长而复杂视频的开放视听智能

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(美国NVIDIA公司) University of Maryland, USA(美国马里兰大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、eess.AS

AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。

Comments Project Page: https://avflamingo.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15295 2026-07-20 cs.MM cs.AI cs.LG cs.SD 新提交 86%

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

AV-JEPA:将LeJEPA扩展到视听自监督学习

Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, Aalto University, Espoo, Finland(艾尔沃斯大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 研究将LeJEPA扩展到视听自监督学习,核心方法是用早期融合视觉Transformer和模态丢弃作掩码训练模型对齐视图嵌入,主要贡献是实现跨模态对齐,架构简洁,在分类任务中有竞争力且支持零样本音频-视频检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08723 2026-05-12 cs.CV cs.MM 86%

EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing

EAR:增强单模表示以实现弱监督音频视觉视频解析

Huilai Li, Xiaomeng Di, Ying Xing, Yonghao Dang, Yiming Wang, Jianqin Yin

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学) State Grid Corporation of China(国家电网公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出EAR框架,通过增强伪标签生成器和AVVP模型的单模表示,提升视频解析的时序定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16617 2026-04-21 cs.CV cs.MM cs.SD 86%

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

AVRT:通过单模态教师模型实现音频-视觉推理迁移

Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza, Brian Kingsbury, Samuel Thomas, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * University of Tübingen, Germany(图宾根大学) MIT, Cambridge MA, USA(麻省理工学院) IBM Research, USA(IBM研究院) MIT-IBM Watson AI Lab, USA(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center, Germany(图宾根人工智能中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出AVRT框架,通过单模态教师模型生成高质量音频-视觉推理轨迹,并利用LLM合并模型整合轨迹,从而在多模态设置中实现推理迁移,取得音视频和音频任务的最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11102 2026-04-14 cs.CV cs.MM 86%

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。

Comments Project Page: https://arcomniscript.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07741 2026-04-10 cs.CV cs.MM 86%

MSCT: Differential Cross-Modal Attention for Deepfake Detection

MSCT:深度伪造检测中的差分跨模态注意力

Fangda Wei, Miao Liu, Yingxue Wang, Jing Wang, Shenghui Zhao, Nan Li

机构 * Beijing Institute of Technology(北京理工大学) China Academy of Electronics and Information Technology(中国电子信息技术研究院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出MSCT模型,通过多尺度自注意力和差分跨模态注意力提升深度伪造检测性能,实验验证其在FakeAVCeleb数据集上的有效性。

Comments Accpeted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13056 2026-03-16 cs.CV cs.AI 86%

Team RAS in 10th ABAW Competition: Multimodal Valence and Arousal Estimation Approach

团队RAS在第10届ABAW竞赛中的表现:多模态valence和arousal估计方法

Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Dmitry Ryumin, Mikhail Dolgushin, Denis Dresvyanskiy, Alexey Karpov

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡联邦研究中心) ITMO University(ITMO大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态方法,用于在真实环境中估计valence和arousal。结合面部、行为和音频模态,利用GRADA、Transformer、Qwen3-VL-4B-Instruct和Mamba等技术,实现跨模态融合,最终在Aff-Wild2数据集上达到0.658的CCC值。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11647 2026-03-16 cs.MM cs.CV cs.SD 86%

OmniForcing: Unleashing Real-time Joint Audio-Visual Generation

OmniForcing:释放实时联合音频视觉生成

Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索学院) Fudan University(复旦大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出OmniForcing框架,通过因果蒸馏将双向扩散模型转化为高保真流式自回归生成器,解决双流架构中的训练不稳定问题,实现25FPS的实时生成性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08967 2026-03-11 cs.CV eess.AS 86%

Can You Hear, Localize, and Segment Continually? An Exemplar-Free Continual Learning Benchmark for Audio-Visual Segmentation

你能持续地听、定位和分割吗?面向音频视频分割的无示例持续学习基准

Siddeshwar Raghavan, Gautham Vinod, Bruce Coburn, Fengqing Zhu

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出无示例持续学习基准和ATLAS模型,通过低秩锚定缓解灾难性遗忘,验证了在动态环境下音频视频分割的持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19080 2025-11-25 cs.MM cs.CV 86%

Towards Generalizable Deepfake Detection via Forgery-aware Audio-Visual Adaptation: A Variational Bayesian Approach

面向可泛化的深度伪造检测的伪造感知音频视觉适应:一种变分贝叶斯方法

Fan Nie, Jiangqun Ni, Jian Zhang, Bin Zhang, Weizhe Zhang, Bin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of New Networks, Pengcheng Laboratory(鹏城实验室网络部) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院) School of Computer Science and Cyber Engineering, Guangzhou University(广州大学计算机科学与网络工程学院) School of Cyberspace Science, Harbin Institute of Technology(哈尔滨工业大学网络空间科学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于变分贝叶斯的伪造感知音频视觉适应方法,通过估计音频视觉相关性来提升深度伪造检测的泛化能力。

Comments TIFS AQE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08031 2025-11-12 cs.CV cs.AI 86%

Multi-modal Deepfake Detection and Localization with FPN-Transformer

Chende Zheng, Ruiqi Suo, Zhoulin Ji, Jingyi Deng, Fangbin Yi, Chenhao Lin, Chao Shen

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23763 2025-11-04 cs.RO cs.CL cs.CV 86%

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

Siyin Wang, Jinlan Fu, Feihong Liu, Xinzhe He, Huangxuan Wu, Junhao Shi, Kexin Huang, Zhaoye Fei, Jingjing Gong, Zuxuan Wu, Yu-Gang Jiang, See-Kiong Ng, Tat-Seng Chua, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21724 2025-10-29 cs.CV cs.AI cs.HC 86%

OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions

Cheng Luo, Jianghui Wang, Bing Li, Siyang Song, Bernard Ghanem

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09945 2025-10-16 cs.MM cs.CV 86%

ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization

Huilai Li, Yonghao Dang, Ying Xing, Yiming Wang, Jianqin Yin

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(智能工程与自动化学院,北京邮电大学) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21377 2025-09-29 cs.CV cs.AI 86%

Dynamic Multi-Target Fusion for Efficient Audio-Visual Navigation

Yinfeng Yu, Hailong Zhang, Meiling Zhu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) No. 59 Middle School of Urumqi(乌鲁木齐市第五十九中学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Main paper (8 pages). Accepted for publication by ECAI( European Conference on Artificial Intelligence) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15476 2025-09-22 cs.CL cs.MM 86%

Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding

Zhu Li, Xiyuan Gao, Yuqing Zhang, Shekhar Nayak, Matt Coler

机构 * University of Groningen, The Netherlands(Groningen大学,荷兰)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18778 2025-04-08 cs.LG cs.AI cs.CL 86%

M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance

Qingpei Guo, Kaiyou Song, Zipeng Feng, Ziping Ma, Qinglong Zhang, Sirui Gao, Xuzheng Yu, Yunxiao Sun, Tai-Wei Chang, Jingdong Chen, Ming Yang, Jun Zhou

专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.07611 2024-10-28 cs.CV cs.MM 86%

Noise-Tolerant Learning for Audio-Visual Action Recognition

Haochen Han, Qinghua Zheng, Minnan Luo, Kaiyao Miao, Feng Tian, Yan Chen

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05964 2024-10-10 cs.CV cs.AI 86%

STNet: Deep Audio-Visual Fusion Network for Robust Speaker Tracking

Yidi Li, Hong Liu, Bing Yang

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19514 2024-07-30 cs.CV cs.MM 86%

Detached and Interactive Multimodal Learning

Yunfeng Fan, Wenchao Xu, Haozhao Wang, Junhong Liu, Song Guo

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02554 2024-06-06 eess.AS cs.AI cs.CL cs.CV cs.LG cs.MM 86%

Hear Me, See Me, Understand Me: Audio-Visual Autism Behavior Recognition

Shijian Deng, Erin E. Kosloski, Siddhi Patel, Zeke A. Barnett, Yiyang Nan, Alexander Kaplan, Sisira Aarukapalli, William T. Doan, Matthew Wang, Harsh Singh, Pamela R. Rollins, Yapeng Tian

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10955 2021-04-23 cs.CV cs.AI cs.LG 86%

Distilling Audio-Visual Knowledge by Compositional Contrastive Learning

Yanbei Chen, Yongqin Xian, A. Sophia Koepke, Ying Shan, Zeynep Akata

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08685 2019-09-20 cs.CV cs.SD eess.AS 86%

Deep Latent Space Learning for Cross-modal Mapping of Audio and Visual Signals

Shah Nawaz, Muhammad Kamran Janjua, Ignazio Gallo, Arif Mahmood, Alessandro Calefati

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted to DICTA 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.02200 2018-01-09 cs.IR cs.CV cs.SD eess.AS 86%

Cross-modal Embeddings for Video and Audio Retrieval

Didac Surís, Amanda Duarte, Amaia Salvador, Jordi Torres, Xavier Giró-i-Nieto

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13470 2023-09-26 cs.CV 86%

HAVE-Net: Hallucinated Audio-Visual Embeddings for Few-Shot Classification with Unimodal Cues

Ankit Jha, Debabrata Pal, Mainak Singha, Naman Agarwal, Biplab Banerjee

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract,comments);cross-modal(abstract);分类 cs.CV

Comments 8 Page, 2 Figures, 2 Tables, Accepted in Adapting to Change: Reliable Multimodal Learning Across Domains Workshop, ECML PKDD 2023

详情

展开后加载摘要…

URL PDF HTML 收藏