arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2602.11596 2026-02-13 cs.AI 70%

MAPLE: Modality-Aware Post-training and Learning Ecosystem

MAPLE: 多模态感知的后训练与学习生态系统

Nikhil Verma, Minjung Kim, JooYoung Yoo, Kyung-Min Jin, Manasa Bharadwaj, Kevin Ferreira, Ko Keun Kim, Youngjoon Kim

机构 * LG Electronics Toronto AI Lab, Toronto, Canada(LG电子多伦多AI实验室) LG Electronics CTO AI Lab, Seoul, Republic of Korea(LG电子CTO AI实验室)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 MAPLE通过模态感知的后训练与学习生态系统,提升多模态强化学习的准确性、收敛速度和稳定性。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02591 2026-02-04 cs.SD cs.AI 70%

VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis

VividVoice: 一个统一的框架,用于场景感知的视觉驱动语音合成

Chengyuan Ma, Jiawei Jin, Ruijie Xiong, Chunxiang Jin, Canxiang Yan, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Ant Group, China(蚂蚁集团)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 VividVoice通过构建大规模多模态数据集和设计核心对齐模块,提升了场景感知的视觉驱动语音合成的音频保真度和多模态一致性。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19469 2026-01-26 cs.SD cs.MM 70%

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

MusiCRS:面向音频导向的对话推荐基准测试

Rohan Surana, Amit Namburi, Gagan Mundada, Abhay Lal, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego, USA(加州大学圣地亚哥分校)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 MusiCRS通过链接Reddit用户对话与音乐曲目,为音频导向的对话推荐提供首个基准测试,揭示了跨模态整合的局限性,并释放了相关数据集和代码以促进研究进展。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02753 2026-01-07 eess.AS 70%

Vclip: Face-based Speaker Generation by Face-voice Association Learning

基于面部的语音生成:通过面部-语音关联学习

Yao Shi, Yunfei Xu, Hongbin Suo, Yulong Wan, Haifeng Liu

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 Vclip通过面部-语音关联学习实现基于面部的语音生成,利用CLIP编码器和检索策略提升语音合成质量。

Comments work done in 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02005 2025-12-30 cs.CV 70%

Learning Visual Affordance from Audio

从音频学习视觉可及性

Lidong Lu, Guo Chen, Zhu Wei, Yicheng Liu, Tong Lu

机构 * Nanjing University(南京大学) China Mobile Communications Company Limited Research Institute(中国移动通信有限公司研究院)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 AVAGFormer通过融合音频和视觉信号,实现了从音频学习视觉可及性的任务,提升了交互区域的识别性能。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12424 2025-12-19 cs.LG cs.AI cs.IR 70%

Multi-Modality Collaborative Learning for Sentiment Analysis

多模态协作学习用于情感分析

Shanmin Wang, Chengguang Liu, Qingshan Liu

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出多模态协作学习框架,通过解耦模块和策略模型提升跨模态情感特征学习,实验证明在四个数据库上性能显著提升。

Comments The method has flaws, especially with the decoupling module. During the decoupling process, the heterogeneity of the three modal data and the differences in distribution were not taken into account

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV 70%

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22025 2025-12-01 cs.CV 70%

Layover or Direct Flight: Rethinking Audio-Guided Image Segmentation

转折或直接飞行:重新思考音频引导的图像分割

Joel Alberto Santos, Zongwei Wu, Xavier Alameda-Pineda, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学、德国) Inria at Univ. Grenoble Alpes, CNRS, LJK, France(Inria于格勒诺布尔阿尔卑斯大学、CNRS、LJK、法国)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出通过直接音频-视觉对齐进行图像分割,无需依赖文本转录,提升了鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11000 2025-11-18 cs.SD cs.AI 70%

DialogGraph-LLM: Graph-Informed LLMs for End-to-End Audio Dialogue Intent Recognition

HongYu Liu, Junxin Li, Changxi Guo, Hao Chen, Yaqian Huang, Yifu Guo, Huan Yang, Lihua Cai

机构 * South China Normal University, Guangzhou, China(华南师范大学) Xiamen Rekey Medical Technology Co., LTD, Xiamen, China(厦门瑞康医疗科技有限公司)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

Comments 8 pages, 2 figures. To appear in: Proceedings of the 28th European Conference on Artificial Intelligence (ECAI 2025), Frontiers in Artificial Intelligence and Applications, Vol. 413. DOI: 10.3233/FAIA251182

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04592 2025-09-30 cs.CV 70%

Face-voice Association in Multilingual Environments (FAME) 2026 Challenge Evaluation Plan

Marta Moscati, Ahmed Abdullah, Muhammad Saad Saeed, Shah Nawaz, Rohan Kumar Das, Muhammad Zaigham Zaheer, Junaid Mir, Muhammad Haroon Yousaf, Khalid Malik, Markus Schedl

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) University of Michigan(密歇根大学) Fortemedia Singapore(Fortemedia新加坡分公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Engineering and Technology Taxila(塔希尔工程与技术大学) Human-centered AI Group(以人为本的人工智能小组)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

Comments 4 pages, ICASSP'26, SP Grand Challenge'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16922 2025-09-23 cs.SD cs.AI eess.IV 70%

PGSTalker: Real-Time Audio-Driven Talking Head Generation via 3D Gaussian Splatting with Pixel-Aware Density Control

Tianheng Zhu, Yinfeng Yu, Liejun Wang, Fuchun Sun, Wendong Zheng

机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术创新研究中心) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.AI

Comments Main paper (15 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02318 2025-09-23 cs.SD cs.AI cs.CL cs.LG cs.MM eess.AS 70%

Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models

Zhifei Xie, Mingbao Lin, Zihang Liu, Pengcheng Wu, Shuicheng Yan, Chunyan Miao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Rakuten

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

Comments Technical report, in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16375 2025-09-23 cs.CL 70%

Whisper-UT: A Unified Translation Framework for Speech and Text

Cihan Xiao, Matthew Wiesner, Debashish Chakraborty, Reno Kriz, Keith Cunningham, Kenton Murray, Kevin Duh, Luis Tavarez-Arce, Paul McNamee, Sanjeev Khudanpur

机构 * Center for Language and Speech Processing, Johns Hopkins University(语言与语音处理中心,约翰霍普金斯大学) Human Language Technology Center of Excellence, Johns Hopkins University(人类语言技术卓越中心,约翰霍普金斯大学) Georgetown University(乔治城大学)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15775 2025-09-22 cs.SD eess.AS 70%

EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model

Yiqing Yang, Man-Wai Mak

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 eess.AS

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16724 2025-09-19 cs.SD eess.AS 70%

SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing

Jinbo Hu, Yin Cao, Ming Wu, Zhenbo Luo, Jun Yang

机构 * Institute of Acoustics, Chinese Academy of Sciences, China(中国科学院声学研究所) MiLM Plus, Xiaomi Inc., China(小米公司) Xi’an Jiaotong Liverpool University, China(西安交通大学利物浦大学) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 eess.AS

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12204 2025-09-16 cs.CV 70%

Character-Centric Understanding of Animated Movies

Zhongrui Gui, Junyu Xie, Tengda Han, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group Dept.\ of Engineering Science University of Oxford, UK School of Artifitial Intelligence\ Jiao Tong University Shanghai China School of Artifitial Intelligence\ Jiao Tong University

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09747 2025-09-15 cs.LG cs.AI cs.RO 70%

D-CAT: Decoupled Cross-Attention Transfer between Sensor Modalities for Unimodal Inference

Leen Daher, Zhaobo Wang, Malcolm Mielle

机构 * Ecole Polytechnique Federale de Lausanne(瑞士联邦理工学院洛桑分校) Schindler EPFL Lab(Schindler EPFL实验室)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03212 2025-09-04 cs.CV 70%

AIVA: An AI-based Virtual Companion for Emotion-aware Interaction

Chenxi Li

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15716 2025-08-25 cs.HC cs.AI 70%

Foundation Models for Cross-Domain EEG Analysis Application: A Survey

Hongqi Li, Yitong Chen, Yujuan Wang, Weihang Ni, Haodong Zhang

机构 * School of Software, Northwestern Polytechnical University(软件学院,西北工业大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments Submitted to IEEE Journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14130 2025-08-21 eess.AS cs.LG 70%

EmoSLLM: Parameter-Efficient Adaptation of LLMs for Speech Emotion Recognition

Hugo Thimonier, Antony Perzo, Renaud Seguier

机构 * Emobot CentraleSupélec IETR (UMR CNRS 6164)(IETR)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21847 2025-08-19 cs.CV cs.SD 70%

Differentiable Room Acoustic Rendering with Multi-View Vision Priors

Derong Jin, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

Comments ICCV 2025 (Oral); Project Page: https://humathe.github.io/avdar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02929 2025-08-07 cs.HC cs.SD eess.AS 70%

AudioMiXR: Spatial Audio Object Manipulation with 6DoF for Sound Design in Augmented Reality

Brandon Woodard, Margarita Geleta, Joseph J. LaViola, Andrea Fanelli, Rhonda Wilson

机构 * Brown University(布朗大学) University of California at Berkeley(加州大学伯克利分校) University of Central Florida(中央佛罗里达大学) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS

Comments Updated abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21254 2025-08-06 cs.CV cs.AI cs.MM cs.SD eess.AS 70%

Vision-to-Music Generation: A Survey

Zhaokai Wang, Chenxi Bao, Le Zhuo, Jingrui Han, Yang Yue, Yihong Tang, Victor Shea-Jay Huang, Yue Liao

机构 * Shanghai Jiao Tong University(上海交通大学) Music Tech Lab, DynamiX(音乐科技实验室,DynamiX) Shanghai AI Laboratory(上海人工智能实验室) Beijing Film Academy(北京电影学院) Tsinghua University(清华大学) McGill University(麦吉尔大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

Journal ref ISMIR 2025 "A Survey on Vision to Music Generation: Methods, Datasets, Evaluation, and Challenges"

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14215 2025-07-22 cs.LG cs.SD eess.AS 70%

Developing an AI-Guided Assistant Device for the Deaf and Hearing Impaired

Jiayu, Liu

机构 * Jiayu (Jerry) Liu(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11143 2025-07-15 cs.CV 70%

On the development of an AI performance and behavioural measures for teaching and classroom management

Andreea I. Niculescu, Jochen Ehnes, Chen Yi, Du Jiawei, Tay Chiat Pin, Joey Tianyi Zhou, Vigneshwaran Subbaraju, Teh Kah Kuan, Tran Huy Dat, John Komar, Gi Soong Chee, Kenneth Kwok

机构 * A*STAR Inst. for Infocomm Research(A*STAR信息与通信研究所) National Institute of Education NTU(国家教育研究所NTU)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

Comments 7 pages, 10 figures, A video demonstration of the teacher trainer dashboard can be accessed here: https://vimeo.com/1076482827

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04959 2025-07-15 cs.CV cs.AI cs.MM cs.SD eess.AS 70%

Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation

Yingshan Liang, Keyu Fan, Zhicheng Du, Yiran Wang, Qingyang Shi, Xinyu Zhang, Jiasheng Lu, Peiwu Qin

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04048 2025-07-08 cs.SD eess.AS 70%

CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning

Jiacheng Shi, Yanfu Zhang, Ye Gao

机构 * Department of Computer Science(计算机科学系)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

Comments Accepted to Interspeech2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18735 2025-06-24 cs.IR eess.AS 70%

An Audio-centric Multi-task Learning Framework for Streaming Ads Targeting on Spotify

Shivam Verma, Vivian Chen, Darren Mei

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 eess.AS

Comments Accepted at KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07076 2025-06-10 cs.MM 70%

Harmony-Aware Music-driven Motion Synthesis with Perceptual Constraint on UGC Datasets

Xinyi Wu, Haohong Wang, Aggelos K. Katsaggelos

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16021 2025-06-09 cs.CL cs.AI cs.CV eess.AS 70%

TMT: Tri-Modal Translation between Speech, Image, and Text by Processing Different Modalities as Different Languages

Minsu Kim, Jee-weon Jung, Hyeongseop Rha, Soumi Maiti, Siddhant Arora, Xuankai Chang, Shinji Watanabe, Yong Man Ro

机构 * Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST)) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏