arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2510.16387 2026-01-27 cs.CL cs.AI cs.SD eess.AS 67%

Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment

探测ASR基础模型在二语英语口语评估中的隐藏潜能

Fu-An Chao, Bi-Cheng Yan, Berlin Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文通过探测Whisper模型的隐藏能力,展示了其在二语英语口语评估中的潜力,通过轻量级分类器和辅助线索提升性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05749 2026-01-27 cs.SD 67%

MSF-SER: Enriching Acoustic Modeling with Multi-Granularity Semantics for Speech Emotion Recognition

MSF-SER:通过多粒度语义增强语音情感识别的声学建模

Haoxun Li, Yuqing Sun, Hanlei Shi, Yu Liu, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究所,中国科学院大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 MSF-SER通过多粒度语义融合提升语音情感识别的声学建模效果,解决传统方法在情感表达细节和高层解释性线索方面的不足。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13866 2026-01-21 q-bio.NC 67%

Audio Outperforms Text for Visual Decoding

音频在视觉解码中表现优于文本

Zhengdi Zhang, Hao Zhang, Wenjun Xia

专题命中 音频语音多模态 :multimodal(abstract);image-text(abstract)

AI总结 本研究提出利用听觉表示替代文本描述,发现听觉模态在视觉解码中更高效且准确,揭示了听觉语义在解码视觉认知中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12537 2026-01-19 cs.CL cs.AI eess.AS 67%

What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study

什么使LLM为中心的语音生成中的良好语音分词器?系统研究

Xiaoran Fan, Zhichao Sun, Yangfan Gao, Jingfei Xiong, Hang Yan, Yifei Cao, Jiajun Sun, Shuo Li, Zhihao Zhang, Zhiheng Xi, Yuhao Zhou, Senjie Jin, Changhao Jiang, Junjie Ye, Ming Zhang, Rui Zheng, Zhenhua Han, Yunke Zhang, Demei Yan, Shaokang Dong, Tao Ji, Tao Gui

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文研究了LLM为中心的语音生成中语音分词器设计的影响,通过引入多令牌预测和说话人感知生成,提升了语音生成的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04151 2026-01-14 cs.CV cs.AI cs.MM cs.SD 67%

Apollo: Unified Multi-Task Audio-Video Joint Generation

Apollo:统一多任务音频视频联合生成

Jun Wang, Chunyu Qiang, Yuxin Guo, Yiran Wang, Xijuan Zeng, Feng Deng

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Apollo通过统一多任务架构、渐进训练策略和大规模数据集,实现音频视频联合生成的高保真度与强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02624 2026-01-07 cs.HC 67%

EgoLog: Ego-Centric Fine-Grained Daily Log with Ubiquitous Wearables

EgoLog:基于普及式可穿戴设备的以自我为中心的细粒度日常日志

Lixing He, Bufang Yang, Di Duan, Zhenyu Yan, Guoliang Xing

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 EgoLog通过融合音频与IMU数据及LLM推理,实现了基于普及式可穿戴设备的细粒度日常日志识别,提升了场景和活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12489 2025-12-23 eess.AS cs.AI cs.MM 67%

A Comprehensive Survey on Generative AI for Video-to-Music Generation

生成式AI在视频到音乐生成中的全面综述

Shulei Ji, Songruoyao Wu, Zihao Wang, Shuyu Li, Kejun Zhang

机构 * Zhejiang University(浙江大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文综述了生成式AI在视频到音乐生成中的关键技术和方法,分析了输入构造、条件机制和音乐生成框架,并总结了现有数据集和评估指标及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13131 2025-12-16 cs.AI cs.CV cs.GR cs.MM cs.SD 67%

Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning

基于层次隐周期学习的统一语音同步手势生成

Xin Guo, Yifan Zhao, Jia Li

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出基于层次隐周期学习的统一语音同步手势生成方法,通过周期自动编码器和级联指导技术提升手势生成的自然性和协调性。

Comments IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08405 2025-12-10 cs.RO 67%

Learning Robot Manipulation from Audio World Models

从音频世界模型中学习机器人操作

Fan Zhang, Michael Gienger

机构 * Honda Research Institute EU(本田欧洲研究院)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出一种生成性潜在流匹配模型,用于通过预测未来音频状态提升机器人操作任务中的多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19361 2025-12-02 cs.CL cs.AI cs.SC cs.SD eess.AS 67%

SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models

SpeechIQ: 大型语言模型在语音理解中的跨认知层级语音智能商

Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi

机构 * Kyoto University(京都大学) NVIDIA Carnegie Mellon University(卡内基梅隆大学) Institute of Science Tokyo(东京科学研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SpeechIQ是一种基于语音的智能评估框架,通过三个认知层级评估大型语言模型在语音理解中的能力,提供统一的比较和识别标注错误与幻觉。

Comments ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18487 2025-11-25 eess.AS cs.AI cs.CL cs.SD 67%

InstructAudio: Unified speech and music generation with natural language instruction

InstructAudio: 通过自然语言指令统一语音和音乐生成

Chunyu Qiang, Kang Yin, Xiaopeng Wang, Yuzhe Liang, Jiahui Zhao, Ruibo Fu, Tianrui Wang, Cheng Gong, Chen Zhang, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 InstructAudio通过自然语言指令统一语音和音乐生成,实现多任务学习和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10913 2025-11-17 cs.SD cs.AI cs.CR cs.MM eess.AS 67%

Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio

Guangke Chen, Yuhui Wang, Shouling Ji, Xiapu Luo, Ting Wang

机构 * Stony Brook University(石英布鲁克大学) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09958 2025-11-14 cs.RO cs.SD 67%

Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation

Xiangyi Wei, Haotian Zhang, Xinyi Cao, Siyu Xie, Weifeng Ge, Yang Li, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) School of Data Science and Engineering, East China Normal University(东华师范大学数据科学与工程学院) School of Software Engineering, East China Normal University(东华师范大学软件工程学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09205 2025-11-12 cs.MM cs.CL cs.IR cs.SD eess.AS 67%

Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model

Ali Vosoughi, Dimitra Emmanouilidou, Hannes Gamper

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM、eess.AS

Comments Accepted at EUSIPCO 2025 - 5 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08039 2025-11-05 cs.SD cs.CL cs.MM eess.AS 67%

Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning

Shu Wu, Chenxing Li, Wenfu Wang, Hao Zhang, Hualei Wang, Meng Yu, Dong Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM、eess.AS

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04273 2025-10-28 cs.IR cs.CV cs.MM cs.SD eess.AS 67%

Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval

Junan Lin, Daizong Liu, Xianke Chen, Xiaoye Qu, Xun Yang, Jixiang Zhu, Sanyuan Zhang, Jianfeng Dong

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Zhejiang Gongshang University(浙江工商大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16893 2025-10-21 cs.SD cs.AI cs.CL eess.AS 67%

Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations

Bo-Han Feng, Chien-Feng Liu, Yu-Hsuan Li Liang, Chih-Kai Yang, Szu-Wei Fu, Zhehuai Chen, Ke-Han Lu, Sung-Feng Huang, Chao-Han Huck Yang, Yu-Chiang Frank Wang, Yun-Nung Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01879 2025-10-21 cs.MM cs.CV cs.SD eess.AS 67%

Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision

Che Liu, Yingji Zhang, Dong Zhang, Weijie Zhang, Chenggong Gong, Yu Lu, Shilin Zhou, Ziliang Gan, Ziao Wang, Haipang Wu, Ji Liu, André Freitas, Qifan Wang, Zenglin Xu, Rongjuncheng Zhang, Yong Dai

机构 * Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学) HiThink Research(HiThink研究院) Soochow University(苏州大学) Hong Kong Baptist University(香港 Baptist大学) Idiap Research Institute(Idiap研究 institute) Meta AI Fudan University(复旦大学)

专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project: https://github.com/HiThink-Research/NEXUS-O

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11330 2025-10-14 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap

KiHyun Nam, Jongmin Choi, Hyeongkeun Lee, Jungwoo Heo, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) University of Seoul, South Korea(首尔大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 5 pages. Submitted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07293 2025-10-09 cs.SD cs.AI cs.CL eess.AS 67%

AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs

Peize He, Zichen Wen, Yubo Wang, Yuxuan Wang, Xiaoqian Liu, Jiajie Huang, Zehui Lei, Zhuangcheng Gu, Xiangqi Jin, Jiabing Yang, Kai Li, Zhifei Liu, Weijia Li, Cunxiang Wang, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Sun Yat-sen University(中山大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 26 pages, 23 figures, the code is available at \url{https://github.com/DabDans/AudioMarathon}

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16765 2025-10-09 cs.CL cs.AI cs.SD eess.AS 67%

The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology

Fagun Patel, Duc Q. Nguyen, Sang T. Truong, Jody Vaynshtok, Sanmi Koyejo, Nick Haber

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Sound Speech and Hearing Clinic(语音与听力诊所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments EMNLP 2025 Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04738 2025-10-07 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba

Baher Mohammad, Magauiya Zhussip, Stamatios Lefkimmiatis

机构 * MTS AI(MTS人工智能公司) ITMO University(ITMO大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22651 2025-09-29 cs.CL cs.AI cs.CV cs.HC cs.SD 67%

VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing

Ke Wang, Houxing Ren, Zimu Lu, Mingjie Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) SenseTime Research(商汤科技研究院) CPII under InnoHK(创新香港下的CPII)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17022 2025-09-23 cs.MM cs.CV cs.SD eess.AS 67%

VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module

Kam Man Wu, Zeyue Tian, Liya Ji, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11538 2025-09-12 cs.CL cs.AI eess.AS 67%

MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond

Muhammad Huzaifah, Geyu Lin, Tianchi Liu, Hardik B. Sailor, Kye Min Tan, Tarun K. Vangani, Qiongqiong Wang, Jeremy H. M. Wong, Jinyang Wu, Nancy F. Chen, Ai Ti Aw

机构 * MERaLiON Team(MERaLiON团队) Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息通信研究所(I2R),A*STAR,新加坡)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21619 2025-09-04 cs.CL cs.AI cs.SD eess.AS 67%

IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech

Siyi Zhou, Yiquan Zhou, Yi He, Xun Zhou, Jinchao Wang, Wei Deng, Jingchen Shu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11079 2025-09-01 eess.AS cs.AI cs.CL cs.SD 67%

Improving Child Speech Recognition and Reading Mistake Detection by Using Prompts

Lingyun Gao, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments This paper is accepted to Interspeech 2025. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants which is financed by the Dutch Research Council (NWO)

Journal ref https://www.isca-archive.org/interspeech_2025/gao25c_interspeech.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01263 2025-08-26 cs.MM cs.CV cs.SD eess.AS 67%

FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing

Gaoxiang Cong, Liang Li, Jiadong Pan, Zhedong Zhang, Amin Beheshti, Anton van den Hengel, Yuankai Qi, Qingming Huang

机构 * Institute of Computing Technology, Chinese Academy of Sciences \& University of Chinese Academy of Sciences Beijing China Institute of Computing Technology, Chinese Academy of Sciences Beijing China Hangzhou Dianzi University Hangzhou China Macquarie University Sydney Australia University of Adelaide Adelaide Australia University of Chinese Academy of Sciences Beijing China Institute of Computing Technology, Chinese Academy of Sciences \& University of Chinese Academy of Sciences Institute of Computing Technology, Chinese Academy of Sciences Hangzhou Dianzi University Macquarie University University of Adelaide University of Chinese Academy of Sciences

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21054 2025-08-25 cs.CL cs.AI cs.LG cs.SD eess.AS 67%

Sentiment Reasoning for Healthcare

Khai-Nguyen Nguyen, Khai Le-Duc, Bach Phan Tat, Duy Le, Long Vo-Dang, Truong-Son Hy

机构 * College of William and Mary(威廉与玛丽学院) University of Toronto(多伦多大学) University Health Network(大学健康网络) KU Leuven(鲁汶大学) Bucknell University(巴克内尔大学) University of Cincinnati(辛辛那提大学) University of Alabama at Birmingham(伯明翰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments ACL 2025 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏