arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2411.12174 2026-02-18 cs.LG cs.AI cs.CL cs.CV 67%

Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memes

Just KIDDIN: 基于知识注入与蒸馏的有害表情包检测

Rahul Garg, Trilok Padhi, Hemang Jain, Ugur Kursuncu, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad Georgia State University(佐治亚州立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种结合知识蒸馏与注入的框架,用于提升有害表情包检测的性能,通过整合大规模知识图谱和视觉语言模型,实现更准确的毒性识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09424 2026-02-17 cs.CL cs.AI cs.LG eess.AS 67%

The Speech-LLM Takes It All: A Truly Fully End-to-End Spoken Dialogue State Tracking Approach

语音大语言模型一网打尽:一种真正端到端的语音对话状态跟踪方法

Nizar El Ghazal, Antoine Caubrière, Valentin Vielzeuf

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出利用语音大语言模型实现端到端语音对话状态跟踪,通过比较不同上下文管理策略,发现完整语音对话输入能获得最佳性能,同时压缩历史信息能保持准确性与效率的平衡。

Comments Accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14127 2026-02-17 cs.SD 67%

MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models

MUKA:多核音频适应音频-语言模型

Reda Bensaid, Amine Ouasfi, Yassir Bendou, Ilyass Moummad, Vincent Gripon, François Leduc-Primeau, Adnane Boukhayma

机构 * Inria, University Rennes, IRISA, CNRS(Inria、里昂大学、IRISA、CNRS)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 MUKA通过结合细粒度表示与全局语义表示,实现音频-语言模型的少样本适应,展现了在适应性和效率上的平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10078 2026-02-13 cs.SD cs.LG 67%

Improving Speech Emotion Recognition with Mutual Information Regularized Generative Model

通过互信息正则化生成模型改进语音情感识别

Chung-Soo Ahn, Rajib Rana, Sunil Sivadas, Carlos Busso, Jagath C. Rajapakse

机构 * College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院) University of Southern Queensland(南方昆士兰大学) NCS Group(NCS集团) Language Technologies Institute, School of Computer Science, Carnegie Mellon University(计算机科学学院语言技术研究所,卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出了一种基于互信息正则化的生成模型,通过跨模态对齐和特征合成提升语音情感识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09378 2026-02-13 cs.SD cs.AI cs.MM eess.AS 67%

Prevailing Research Areas for Music AI in the Era of Foundation Models

基础模型时代音乐AI的主流研究领域

Megan Wei, Mateusz Modrzejewski, Aswin Sivaraman, Dorien Herremans

机构 * Brown University(布朗大学) Warsaw University of Technology(华沙技术大学) Indiana University(印第安纳大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文探讨了基础模型时代音乐AI的研究领域,涵盖基础模型、多模态系统、数据集、效率、生成模型应用及版权问题,旨在揭示未来研究方向。

Journal ref Proceedings of Machine Learning Research, PMLR 303:1-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05093 2026-02-06 cs.HC 67%

VR Calm Plus: Coupling a Squeezable Tangible Interaction with Immersive VR for Stress Regulation

VR Calm Plus:将可压缩的实体交互与沉浸式VR结合用于压力调节

He Zhang, Xinyang Li, Xingyu Zhou, Xinyi Fu

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 VR Calm Plus通过结合可压缩实体交互与沉浸式VR,提升压力调节效果,增强积极情绪与放松体验。

Comments This work has been conditionally accepted by the ACM CHI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00189 2026-02-03 cs.SD cs.AI cs.MM eess.AS 67%

LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild

LPIPS-AttnWav2Lip:通用音频驱动的唇同步生成野态说话人面部图像

Zhipeng Chen, Xinheng Wang, Lun Xie, Haijie Yuan, Hang Pan

机构 * University of Science and Technology Beijing(北京科技大学) Xiaoduo Intelligent Technology (Beijing) Co., Ltd(小多智能技术(北京)有限公司) Department of Computer Science, Changzhi University(长治大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出LPIPS-AttnWav2Lip方法,通过音频驱动生成逼真高质的说话人面部图像,实现精确唇同步和视觉质量提升。

Comments This paper has been accepted by Elsevier's \textit{Speech Communication} journal. Official publication link: https://doi.org/10.1016/j.specom.2023.103028 The code for the paper is available at the following link: https://github.com/FelixChan9527/LPIPS-AttnWav2Lip

Journal ref Speech Communication 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18451 2026-01-27 cs.CV cs.AI cs.LG cs.MM cs.SD 67%

3DGesPolicy: Phoneme-Aware Holistic Co-Speech Gesture Generation Based on Action Control

3DGesPolicy: 基于动作控制的音素感知整体语义手势生成

Xuanmeng Sha, Liyun Zhang, Tomohiro Mashita, Naoya Chiba, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Osaka Electro-Communication University(大阪电讯大学) Osaka University(大阪大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 3DGesPolicy通过基于动作控制的框架,结合音素感知和多模态信号融合,实现了更自然且高度语音对齐的整体语义手势生成。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16387 2026-01-27 cs.CL cs.AI cs.SD eess.AS 67%

Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment

探测ASR基础模型在二语英语口语评估中的隐藏潜能

Fu-An Chao, Bi-Cheng Yan, Berlin Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文通过探测Whisper模型的隐藏能力,展示了其在二语英语口语评估中的潜力,通过轻量级分类器和辅助线索提升性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05749 2026-01-27 cs.SD 67%

MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition

MSF-SER:通过多粒度语义增强语音情感识别的声学建模

Haoxun Li, Yuqing Sun, Hanlei Shi, Yu Liu, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究所,中国科学院大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 MSF-SER通过多粒度语义融合提升语音情感识别的声学建模效果,解决传统方法在情感表达细节和高层解释性线索方面的不足。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13866 2026-01-21 q-bio.NC 67%

Audio Outperforms Text for Visual Decoding

音频在视觉解码中表现优于文本

Zhengdi Zhang, Hao Zhang, Wenjun Xia

专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract)

AI总结 本研究提出利用听觉表示替代文本描述,发现听觉模态在视觉解码中更高效且准确,揭示了听觉语义在解码视觉认知中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12537 2026-01-19 cs.CL cs.AI eess.AS 67%

What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study

什么使LLM为中心的语音生成中的良好语音分词器?系统研究

Xiaoran Fan, Zhichao Sun, Yangfan Gao, Jingfei Xiong, Hang Yan, Yifei Cao, Jiajun Sun, Shuo Li, Zhihao Zhang, Zhiheng Xi, Yuhao Zhou, Senjie Jin, Changhao Jiang, Junjie Ye, Ming Zhang, Rui Zheng, Zhenhua Han, Yunke Zhang, Demei Yan, Shaokang Dong, Tao Ji, Tao Gui

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文研究了LLM为中心的语音生成中语音分词器设计的影响,通过引入多令牌预测和说话人感知生成,提升了语音生成的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04151 2026-01-14 cs.CV cs.AI cs.MM cs.SD 67%

Apollo: Unified Multi-Task Audio-Video Joint Generation

Apollo:统一多任务音频视频联合生成

Jun Wang, Chunyu Qiang, Yuxin Guo, Yiran Wang, Xijuan Zeng, Feng Deng

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Apollo通过统一多任务架构、渐进训练策略和大规模数据集,实现音频视频联合生成的高保真度与强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02624 2026-01-07 cs.HC 67%

EgoLog: Ego-Centric Fine-Grained Daily Log with Ubiquitous Wearables

EgoLog:基于普及式可穿戴设备的以自我为中心的细粒度日常日志

Lixing He, Bufang Yang, Di Duan, Zhenyu Yan, Guoliang Xing

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 EgoLog通过融合音频与IMU数据及LLM推理,实现了基于普及式可穿戴设备的细粒度日常日志识别,提升了场景和活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12489 2025-12-23 eess.AS cs.AI cs.MM 67%

A Comprehensive Survey on Generative AI for Video-to-Music Generation

生成式AI在视频到音乐生成中的全面综述

Shulei Ji, Songruoyao Wu, Zihao Wang, Shuyu Li, Kejun Zhang

机构 * Zhejiang University(浙江大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文综述了生成式AI在视频到音乐生成中的关键技术和方法,分析了输入构造、条件机制和音乐生成框架,并总结了现有数据集和评估指标及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13131 2025-12-16 cs.AI cs.CV cs.GR cs.MM cs.SD 67%

Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning

基于层次隐周期学习的统一语音同步手势生成

Xin Guo, Yifan Zhao, Jia Li

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出基于层次隐周期学习的统一语音同步手势生成方法,通过周期自动编码器和级联指导技术提升手势生成的自然性和协调性。

Comments IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08405 2025-12-10 cs.RO 67%

Learning Robot Manipulation from Audio World Models

从音频世界模型中学习机器人操作

Fan Zhang, Michael Gienger

机构 * Honda Research Institute EU(本田欧洲研究院)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出一种生成性潜在流匹配模型,用于通过预测未来音频状态提升机器人操作任务中的多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19361 2025-12-02 cs.CL cs.AI cs.SC cs.SD eess.AS 67%

SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models

SpeechIQ: 大型语言模型在语音理解中的跨认知层级语音智能商

Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi

机构 * Kyoto University(京都大学) NVIDIA Carnegie Mellon University(卡内基梅隆大学) Institute of Science Tokyo(东京科学研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SpeechIQ是一种基于语音的智能评估框架,通过三个认知层级评估大型语言模型在语音理解中的能力,提供统一的比较和识别标注错误与幻觉。

Comments ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18487 2025-11-25 eess.AS cs.AI cs.CL cs.SD 67%

InstructAudio: Unified speech and music generation with natural language instruction

InstructAudio: 通过自然语言指令统一语音和音乐生成

Chunyu Qiang, Kang Yin, Xiaopeng Wang, Yuzhe Liang, Jiahui Zhao, Ruibo Fu, Tianrui Wang, Cheng Gong, Chen Zhang, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 InstructAudio通过自然语言指令统一语音和音乐生成,实现多任务学习和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10913 2025-11-17 cs.SD cs.AI cs.CR cs.MM eess.AS 67%

Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio

Guangke Chen, Yuhui Wang, Shouling Ji, Xiapu Luo, Ting Wang

机构 * Stony Brook University(石英布鲁克大学) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09958 2025-11-14 cs.RO cs.SD 67%

Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation

Xiangyi Wei, Haotian Zhang, Xinyi Cao, Siyu Xie, Weifeng Ge, Yang Li, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) School of Data Science and Engineering, East China Normal University(东华师范大学数据科学与工程学院) School of Software Engineering, East China Normal University(东华师范大学软件工程学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09205 2025-11-12 cs.MM cs.CL cs.IR cs.SD eess.AS 67%

Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model

Ali Vosoughi, Dimitra Emmanouilidou, Hannes Gamper

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM、eess.AS

Comments Accepted at EUSIPCO 2025 - 5 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08039 2025-11-05 cs.SD cs.CL cs.MM eess.AS 67%

Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning

Shu Wu, Chenxing Li, Wenfu Wang, Hao Zhang, Hualei Wang, Meng Yu, Dong Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM、eess.AS

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04273 2025-10-28 cs.IR cs.CV cs.MM cs.SD eess.AS 67%

Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval

Junan Lin, Daizong Liu, Xianke Chen, Xiaoye Qu, Xun Yang, Jixiang Zhu, Sanyuan Zhang, Jianfeng Dong

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Zhejiang Gongshang University(浙江工商大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16893 2025-10-21 cs.SD cs.AI cs.CL eess.AS 67%

Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations

Bo-Han Feng, Chien-Feng Liu, Yu-Hsuan Li Liang, Chih-Kai Yang, Szu-Wei Fu, Zhehuai Chen, Ke-Han Lu, Sung-Feng Huang, Chao-Han Huck Yang, Yu-Chiang Frank Wang, Yun-Nung Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01879 2025-10-21 cs.MM cs.CV cs.SD eess.AS 67%

Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision

Che Liu, Yingji Zhang, Dong Zhang, Weijie Zhang, Chenggong Gong, Yu Lu, Shilin Zhou, Ziliang Gan, Ziao Wang, Haipang Wu, Ji Liu, André Freitas, Qifan Wang, Zenglin Xu, Rongjuncheng Zhang, Yong Dai

机构 * Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学) HiThink Research(HiThink研究院) Soochow University(苏州大学) Hong Kong Baptist University(香港 Baptist大学) Idiap Research Institute(Idiap研究 institute) Meta AI Fudan University(复旦大学)

专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project: https://github.com/HiThink-Research/NEXUS-O

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11330 2025-10-14 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap

KiHyun Nam, Jongmin Choi, Hyeongkeun Lee, Jungwoo Heo, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) University of Seoul, South Korea(首尔大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 5 pages. Submitted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07293 2025-10-09 cs.SD cs.AI cs.CL eess.AS 67%

AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs

Peize He, Zichen Wen, Yubo Wang, Yuxuan Wang, Xiaoqian Liu, Jiajie Huang, Zehui Lei, Zhuangcheng Gu, Xiangqi Jin, Jiabing Yang, Kai Li, Zhifei Liu, Weijia Li, Cunxiang Wang, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Sun Yat-sen University(中山大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 26 pages, 23 figures, the code is available at \url{https://github.com/DabDans/AudioMarathon}

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16765 2025-10-09 cs.CL cs.AI cs.SD eess.AS 67%

The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology

Fagun Patel, Duc Q. Nguyen, Sang T. Truong, Jody Vaynshtok, Sanmi Koyejo, Nick Haber

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Sound Speech and Hearing Clinic(语音与听力诊所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments EMNLP 2025 Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏