arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4567 篇

2608.05495 2026-08-07 cs.CR cs.HC 新提交 87%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);audio-visual(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11178 2026-07-30 cs.AI cs.CL cs.MM cs.SI 版本更新 87%

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

TANDEM: 面向多模态仇恨言论的时间感知神经检测

Girish A. Koushik, Helen Treharne, Diptesh Kanojia

机构 * Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系) Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出TANDEM统一框架,通过串联强化学习策略联合优化视觉-语言和音频-语言模型,将音频-视觉仇恨检测转化为结构化推理问题,在HateMM上目标识别F1达0.73(提升30%),并保持精确时间定位。

Comments Accepted to AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交 87%

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 87%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25140 2026-03-27 cs.CV cs.AI cs.LG cs.MM cs.SD 87%

SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment

SAVe:利用视觉伪影和音视频不一致的自监督音频视觉深度伪造检测

Sahibzada Adil Shahzad, Ammarah Hashmi, Junichi Yamagishi, Yusuke Yasuda, Yu Tsao, Chia-Wen Lin, Yan-Tsung Peng, Hsin-Min Wang

机构 * Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所台湾国际研究生计划社交网络与人本计算项目) Department of Computer Science, National Chengchi University(国立政治大学资讯科学系) Institute of Information Systems and Applications, National Tsing Hua University(国立清华大学资讯系统与应用研究所) National Institute of Informatics(国立情报学研究所) Department of Electrical Engineering and the Institute of Communications Engineering, National Tsing Hua University(国立清华大学电机工程学系与通讯工程研究所) Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心) Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SAVe通过自监督学习在真实视频上训练,生成伪篡改以学习互补的视觉线索,并通过音视频对齐组件捕捉跨模态证据,实现对深度伪造的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17862 2026-03-12 cs.AI cs.CL cs.CV 87%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20296 2025-12-24 cs.CV cs.AI eess.AS eess.IV 87%

TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation

TAVID:基于文本的音频视觉交互对话生成

Ji-Hoon Kim, Junseok Ahn, Doyeop Kwak, Joon Son Chung, Shinji Watanabe

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 TAVID通过统一框架同步生成交互面部和对话语音,实现音频视觉多模态对话生成。

Comments Project page: https://mm.kaist.ac.kr/projects/TAVID

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02306 2025-12-03 cs.AI cs.CL cs.CR cs.CV cs.LG 87%

OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning

OmniGuard:统一的多模态防护机制与刻意推理

Boyu Zhu, Xiaofei Wen, Wenjie Jacky Mo, Tinghui Zhu, Yanan Xie, Peng Qi, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06862 2025-06-10 cs.RO cs.AI cs.CV cs.LG cs.SD eess.AS 87%

Multimodal Spatial Language Maps for Robot Navigation and Manipulation

Chenguang Huang, Oier Mees, Andy Zeng, Wolfram Burgard

机构 * University of Technology Nuremberg(图恩堡技术大学) UC Berkeley(伯克利大学) Google Research(谷歌研究)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI、eess.AS

Comments accepted to International Journal of Robotics Research (IJRR). 24 pages, 18 figures. The paper contains texts from VLMaps(arXiv:2210.05714) and AVLMaps(arXiv:2303.07522). The project page is https://mslmaps.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04038 2025-01-09 cs.MM cs.AI cs.SD eess.AS 87%

Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition

Rui Liu, Hongyu Yuan, Haizhou Li

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05412 2024-10-10 cs.LG cs.CV cs.MM cs.SD eess.AS 87%

CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling

Ruihan Yang, Hannes Gamper, Sebastian Braun

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09833 2024-07-17 cs.AI cs.MM cs.SD eess.AS 87%

SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering

Zhe Yang, Wenrui Li, Guanghui Cheng

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04930 2024-06-10 cs.CV cs.MM cs.SD eess.AS 87%

MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers

Tanvir Mahmud, Shentong Mo, Yapeng Tian, Diana Marculescu

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted in Efficient Deep Learning for Computer Vision CVPR Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08143 2024-02-05 cs.SD cs.CV cs.MM eess.AS 87%

IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation

Kai Li, Runxuan Yang, Fuchun Sun, Xiaolin Hu

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02858 2023-10-26 cs.CL cs.CV cs.SD eess.AS 87%

Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Hang Zhang, Xin Li, Lidong Bing

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments Accepted by EMNLP 2023's demo track; Code, Pretrained Model, and Dataset: https://github.com/DAMO-NLP-SG/Video-LLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03533 2023-02-20 cs.CV cs.MM cs.SD eess.AS 87%

Revisiting Pre-training in Audio-Visual Learning

Ruoxuan Feng, Wenke Xia, Di Hu

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03814 2022-12-09 cs.CV cs.MM cs.SD eess.AS 87%

iQuery: Instruments as Queries for Audio-Visual Sound Separation

Jiaben Chen, Renrui Zhang, Dongze Lian, Jiaqi Yang, Ziyao Zeng, Jianbo Shi

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.02216 2022-07-08 cs.SD cs.AI cs.MM eess.AS 87%

Look\&Listen: Multi-Modal Correlation Learning for Active Speaker Detection and Speech Enhancement

Junwen Xiong, Yu Zhou, Peng Zhang, Lei Xie, Wei Huang, Yufei Zha

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS

Comments 13 pages, 8figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.10558 2020-07-23 cs.CV cs.MM cs.SD eess.AS 87%

Unified Multisensory Perception: Weakly-Supervised Audio-Visual Video Parsing

Yapeng Tian, Dingzeyu Li, Chenliang Xu

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments ECCV 2020 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.03875 2019-04-16 cs.CL cs.CV cs.LG eess.AS 87%

Multimodal One-Shot Learning of Speech and Images

Ryan Eloff, Herman A. Engelbrecht, Herman Kamper

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、eess.AS

Comments 5 pages, 1 figure, 3 tables; accepted to ICASSP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09435 2026-08-11 cs.AI 新提交 86%

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

听、看与跟踪:面向全模态大模型的时空视听声音事件推理

Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title);分类 cs.AI

AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01530 2026-06-30 cs.MM 86%

CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction

CueNet:通过跨模态线索挖掘与交互实现鲁棒的音频视觉说话人提取

Jiadong Wang, Ke Zhang, Xinyuan Qian, Ruijie Tao, Haizhou Li, Björn Schuller

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.MM

AI总结 本文提出CueNet,通过跨模态线索挖掘与交互提升音频视觉说话人提取的鲁棒性,验证了模型在不同视觉退化下的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21008 2026-05-21 eess.AS 86%

A Survey of Audio Reasoning in Multimodal Foundation Models

多模态基础模型中音频推理的综述

Zhihan Guo, Wenqian Cui, Guan-Ting Lin, Daxin Tan, Jingyao Li, Qiyong Zheng, Dingdong Wang, Jing Xiong, Han Shi, Jiaya Jia, Irwin King

专题命中 音频语音多模态 :multimodal(title);multimodal foundation model(title);audio-visual(abstract);分类 eess.AS

AI总结 本文综述了多模态基础模型中音频推理的研究问题,探讨了音频推理模型的架构和训练基础,并系统整理了音频到文本、音频到语音、音频视觉推理和代理音频推理等领域的最新进展,同时分析了新兴范式和评估实践,提出了未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18110 2026-02-03 cs.CL 86%

Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM

Watch and Listen: 通过多模态大语言模型理解音频-视觉-语音时刻

Zinuo Li, Xian Zhang, Yongxin Guo, Mohammed Bennamoun, Farid Boussaid, Girish Dwivedi, Luqi Gong, Qiuhong Ke

机构 * University of Western Australia(西澳大学) Alibaba Group(阿里巴巴集团) Zhejiang Laboratory(浙江实验室) Monash University(墨尔本大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CL

AI总结 TriSense通过整合视觉、音频和语音模态,提升视频时间理解能力,采用基于查询的连接器实现多模态鲁棒性,并通过TriSense-2M数据集推动多模态视频分析发展。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02759 2025-12-03 eess.AS cs.SD eess.IV 86%

Towards Language-Independent Face-Voice Association with Multimodal Foundation Models

面向语言无关的面容-语音关联的多模态基础模型

Aref Farhadipour, Teodora Vukovic, Volker Dellwo

机构 * Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系)

专题命中 音频语音多模态 :multimodal(title);multimodal foundation model(title);cross-modal(abstract);分类 eess.AS

AI总结 本文提出了一种基于多模态基础模型的跨语言面容-语音关联方法,通过ImageBind与LoRA结合,实现了在未见过语言上的有效验证。

Comments This paper presents the system description of the UZH-CL team for the FAME2026 Challenge at ICASSP 2026. Our model achieved second place in the final ranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14592 2025-09-19 cs.MM cs.SD 86%

MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion

Junbo Wang, Yan Zhao, Shuo Li, Shibo Wang, Shigang Wang, Jian Wei

机构 * College of Communication Engineering, Jilin University(吉林大学通信工程学院)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08085 2025-01-15 cs.CL cs.LG 86%

Dynamic Multimodal Sentiment Analysis: Leveraging Cross-Modal Attention for Enabled Classification

Hui Lee, Singh Suniljit, Yong Siang Ong

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17796 2024-02-01 cs.SD eess.AS 86%

Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction

Xueyuan Chen, Yuejiao Wang, Xixin Wu, Disong Wang, Zhiyong Wu, Xunying Liu, Helen Meng

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title);分类 eess.AS

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03827 2023-10-09 cs.CV 86%

Integrating Audio-Visual Features for Multimodal Deepfake Detection

Sneha Muppalla, Shan Jia, Siwei Lyu

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04628 2023-09-12 eess.AS cs.SD 86%

Leveraging Pretrained Image-text Models for Improving Audio-Visual Learning

Saurabhchand Bhati, Jesús Villalba, Laureano Moro-Velazquez, Thomas Thebaud, Najim Dehak

专题命中 音频语音多模态 :audio-visual(title,abstract);image-text(title);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏