arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4567 篇

2512.00120 2025-12-02 cs.SD cs.AI cs.CV cs.LG cs.MM 85%

Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment

Art2Music: 通过多模态情感对齐生成艺术图像的音乐

Jiaying Hong, Ting Zhu, Thanet Markchom, Huizhi Liang

机构 * School of Computing Newcastle University(计算学院新castle大学) Department of Computer Science University of Reading(计算机科学系阅读大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Art2Music通过多模态情感对齐生成艺术图像的音乐,利用轻量级跨模态框架提升音乐生成的感知自然性和频谱保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18698 2025-11-25 cs.SD cs.AI cs.CV cs.LG cs.MM 85%

Multimodal Real-Time Anomaly Detection and Industrial Applications

多模态实时异常检测与工业应用

Aman Verma, Keshav Samdani, Mohd. Samiuddin Shafi

机构 * Department of Electrical Engineering IIT Bombay Mumbai, India(电气工程系 印度理工学院Bombay 墨尔本)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出了一种多模态实时异常检测系统,结合视频和音频处理,通过多模型音频集合、混合物体检测和双向跨模态注意力机制,提升了准确性与工业适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10016 2025-11-25 cs.MM cs.AI cs.CL 85%

A Survey of Generative Categories and Techniques in Multimodal Generative Models

多模态生成模型中生成类别的综述

Longzhen Han, Awes Mubarak, Almas Baimagambetov, Nikolaos Polatidis, Thar Baker

机构 * School of Architecture, Technology and Engineering, University of Brighton, Lewes Road, BN2 4GJ(建筑、科技与工程学院,布里顿大学,勒斯路,BN2 4GJ) University of Khorfakkan, Sharjah(柯法克坎大学,沙迦)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本文综述多模态生成模型中生成类别的发展,分析了跨模态能力的基础技术,并探讨了评估框架与治理机制以提升系统通用性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17890 2025-11-25 cs.CV cs.AI cs.MM 85%

Decoupled Audio-Visual Dataset Distillation

解耦音频-视觉数据集蒸馏

Wenyuan Li, Guang Li, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Hokkaido University(北海道大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 DAVDD通过解耦音频-视觉表示提升数据集蒸馏效果,利用预训练库和轻量解耦器实现稳定特征提取与模态隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26825 2025-11-03 cs.SD cs.CV cs.MM eess.AS 85%

Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling

Jiarong Du, Zhan Jin, Peijun Yang, Juan Liu, Zhuo Li, Xin Liu, Ming Li

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Suzhou Municipal Key Laboratory of Multimodal Intelligent Systems, Digital Innovation Research Center, Duke Kunshan University(多模态智能系统苏州市级重点实验室、杜克昆山大学数字创新研究中心) Hardware Engineering System, OPPO(OPPO硬件工程系统)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11760 2025-10-15 cs.SD cs.AI cs.CV cs.MM 85%

Audio-Guided Visual Perception for Audio-Visual Navigation

Yi Wang, Yinfeng Yu, Fuchun Sun, Liejun Wang, Wendong Zheng

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语种认知计算国际联合实验室) Tsinghua University(清华大学) Tianjin University of Technology(天津工业大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Main paper (6 pages). Accepted for publication by International Conference on Virtual Reality and Visualization 2025 (ICVRV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22744 2025-09-30 eess.AS cs.AI cs.MM cs.SD 85%

Index-MSR: A high-efficiency multimodal fusion framework for speech recognition

Jinming Chen, Lu Wang, Zheshu Song, Wei Deng

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments Submit to icassp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13255 2025-09-24 cs.CL cs.AI cs.IR cs.LG cs.MM 85%

Automating Steering for Safe Multimodal Large Language Models

Lyucheng Wu, Mengru Wang, Ziwen Xu, Tri Cao, Nay Oo, Bryan Hooi, Shumin Deng

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) National University of Singapore, NUS-NCS Joint Lab(新加坡国立大学NUS-NCS联合实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

Comments EMNLP 2025 Main Conference. 23 pages (8+ for main); 25 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15661 2025-09-22 cs.SD cs.AI cs.CL eess.AS 85%

SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models

Qiaolin Wang, Xilin Jiang, Linyang He, Junkai Wu, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) University of Washington(华盛顿大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01284 2025-09-15 cs.MM cs.CV cs.SD eess.AS eess.IV 85%

Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework

Liuyuan Wen

机构 * School of Physical Sciences University of Science and Technology of China(中国科学技术大学物理科学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12226 2025-09-09 cs.CL cs.AI cs.CV cs.LG 85%

AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling

Jun Zhan, Junqi Dai, Jiasheng Ye, Yunhua Zhou, Dong Zhang, Zhigeng Liu, Xin Zhang, Ruibin Yuan, Ge Zhang, Linyang Li, Hang Yan, Jie Fu, Tao Gui, Tianxiang Sun, Yu-Gang Jiang, Xipeng Qiu

机构 * Fudan University(复旦大学) Multimodal Art Projection Research Community(多模态艺术投影研究社区) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);any-to-any(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 28 pages, 16 figures, under review, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07608 2025-08-12 cs.MM cs.CV cs.SD eess.AS 85%

AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition

Junxiao Xue, Xiaozhen Liu, Xuecheng Wu, Xinyi Yin, Danlei Huang, Fei Yu

机构 * Zhengzhou University(郑州大学) Zhejiang Lab(浙江实验室) Xi'an Jiaotong University(西安交通大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by the ACM MM 2025 Workshop on SVC

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00733 2025-08-08 cs.SD cs.CV cs.MM eess.AS 85%

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

Le Wang, Jun Wang, Chunyu Qiang, Feng Deng, Chen Zhang, Di Zhang, Kun Gai

机构 * China University of Mining and Technology(中国矿业大学) Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04418 2025-08-07 cs.MM cs.CV cs.MA cs.SD eess.AS 85%

Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation

Jinxing Zhou, Yanghao Zhou, Mingfei Han, Tong Wang, Xiaojun Chang, Hisham Cholakkal, Rao Muhammad Anwer

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project page: https://github.com/jasongief/TGS-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02849 2025-08-06 eess.AS cs.AI cs.CL cs.SD 85%

SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec

Chunyu Qiang, Haoyu Wang, Cheng Gong, Tianrui Wang, Ruibo Fu, Tao Wang, Ruilong Chen, Jiangyan Yi, Zhengqi Wen, Chen Zhang, Longbiao Wang, Jianwu Dang, Jianhua Tao

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) Kuaishou Technology(快手科技) Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学) Department of Automation, BNRist, Tsinghua University(自动化系,北研所,清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16579 2025-07-02 cs.CV cs.MM cs.SD eess.AS 85%

Contrastive Conditional Latent Diffusion for Audio-visual Segmentation

Yuxin Mao, Jing Zhang, Mochu Xiang, Yunqiu Lv, Dong Li, Yiran Zhong, Yuchao Dai

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) Shaanxi Key Laboratory of Information Acquisition and Processing(信息获取与处理陕西省重点实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Journal ref IEEE Transactions on Image Processing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19774 2025-06-25 eess.AS cs.AI cs.CL cs.SD 85%

Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation

Jun Wang, Xijuan Zeng, Chunyu Qiang, Ruilong Chen, Shiyao Wang, Le Wang, Wangjing Zhou, Pengfei Cai, Jiahui Zhao, Nan Li, Zihan Li, Yuzhe Liang, Xiaopeng Wang, Haorui Zheng, Ming Wen, Kang Yin, Yiran Wang, Nan Li, Feng Deng, Liang Dong, Chen Zhang, Di Zhang, Kun Gai

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02621 2025-06-04 cs.SD 85%

Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge

Zhaoyang Li, Haodong Zhou, Longjie Luo, Xiaoxiao Li, Yongxin Chen, Lin Li, Qingyang Hong

机构 * Xiamen University(厦门大学) Beijing Jiaotong University(北京交通大学) School of Electronic Science and Engineering(电子科学与技术学院) School of Electronic Information(电子信息学院) School of Informatics(信息学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05758 2025-05-29 eess.AS cs.AI cs.CL cs.SD 85%

VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing

Chunyu Qiang, Wang Geng, Yi Zhao, Ruibo Fu, Tao Wang, Cheng Gong, Tianrui Wang, Qiuyu Liu, Jiangyan Yi, Zhengqi Wen, Chen Zhang, Hao Che, Longbiao Wang, Jianwu Dang, Jianhua Tao

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) Kuaishou Technology Co., Ltd.(快手科技有限公司) Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学) Department of Automation, Tsinghua University(自动化系,清华大学) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学) Migu Culture Technology Co., Ltd.(咪咕文化科技有限公司) Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20027 2025-05-27 q-bio.NC cs.AI cs.CL cs.LG eess.AS eess.IV 85%

Multi-modal brain encoding models for multi-modal stimuli

Subba Reddy Oota, Khushbu Pahwa, Mounika Marreddy, Maneesh Singh, Manish Gupta, Bapi S. Raju

机构 * Technische Universität Berlin(柏林技术大学) Rice Univ(莱斯大学) Univ of Bonn(波恩大学) Spector Inc(Spector公司) Microsoft(微软) IIIT Hyderabad(海得拉巴国家理工学院)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 26 pages, 15 figures, The Thirteenth International Conference on Learning Representations, ICLR-2025, Singapore. https://openreview.net/pdf?id=0dELcFHig2

Journal ref ICLR-2025, Sinapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01237 2025-05-22 cs.MM cs.CV cs.SD eess.AS 85%

CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment

Edson Araujo, Andrew Rouditchenko, Yuan Gong, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Leonid Karlinsky, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * Goethe University of Frankfurt(法兰克福歌德大学) MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments To be published at CVPR 2025, code available at https://github.com/edsonroteia/cav-mae-sync

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16936 2025-04-25 cs.MM cs.CV cs.SD eess.AS 85%

Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness

Yusheng Zhao, Junyu Luo, Xiao Luo, Weizhi Zhang, Zhiping Xiao, Wei Ju, Philip S. Yu, Ming Zhang

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Washington(华盛顿大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12315 2025-04-18 cs.CL cs.AI cs.CV 85%

Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models

Xingguang Ji, Jiakang Wang, Hongzhi Zhang, Jingyuan Zhang, Haonan Zhou, Chenxi Sun, Yahui Liu, Qi Wang, Fuzheng Zhang

专题命中 音频语音多模态 :omni-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06884 2025-04-10 cs.MM cs.AI cs.CV 85%

Audio-visual Event Localization on Portrait Mode Short Videos

Wuyang Liu, Yi Chai, Yongpeng Yan, Yanzhen Ren

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02061 2025-04-04 cs.CV cs.MM cs.SD eess.AS 85%

Aligned Better, Listen Better for Audio-Visual Large Language Models

Yuxin Guo, Shuailei Ma, Shijie Ma, Xiaoyi Bao, Chen-Wei Xie, Kecheng Zheng, Tingyu Weng, Siyang Sun, Yun Zheng, Wei Zou

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08247 2025-04-01 cs.SD cs.CV cs.MM eess.AS 85%

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues

Junjie Li, Ke Zhang, Shuai Wang, Kong Aik Lee, Man-Wai Mak, Haizhou Li

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23219 2025-04-01 eess.AS cs.AI cs.CV cs.LG 85%

Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs

Sanjoy Chowdhury, Hanan Gani, Nishit Anand, Sayan Nag, Ruohan Gao, Mohamed Elhoseiny, Salman Khan, Dinesh Manocha

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21504 2025-03-28 cs.CL cs.AI cs.CV 85%

Keyword-Oriented Multimodal Modeling for Euphemism Identification

Yuxue Hu, Junsong Li, Meixuan Chen, Dongyu Su, Tongguan Wang, Ying Sha

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18709 2025-03-04 cs.CV cs.LG cs.MM cs.SD eess.AS 85%

Audio-Visual Instance Segmentation

Ruohao Guo, Xianghua Ying, Yaru Chen, Dantong Niu, Guangyao Li, Liao Qu, Yanyu Qi, Jinxing Zhou, Bowei Xing, Wenzhen Yue, Ji Shi, Qixun Wang, Peiliang Zhang, Buwen Liang

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14893 2025-02-24 cs.CV cs.AI cs.LG cs.SD eess.AS 85%

NOTA: Multimodal Music Notation Understanding for Visual Large Language Model

Mingni Tang, Jiajia Li, Lu Yang, Zhiqiang Zhang, Jinghao Tian, Zuchao Li, Lefei Zhang, Ping Wang

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏