arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2511.06606 2025-11-17 eess.AS cs.AI 62%

SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models

S Sakshi, Vaibhavi Lokegaonkar, Neil Zhang, Ramani Duraiswami, Sreyan Ghosh, Dinesh Manocha, Lie Lu

机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Project: https://sakshi113.github.io/spur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27102 2025-11-17 cs.SD cs.AI eess.AS 62%

Expressive Range Characterization of Open Text-to-Audio Models

Jonathan Morse, Azadeh Naderi, Swen Gaudl, Mark Cartwright, Amy K. Hoover, Mark J. Nelson

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Accepted at the AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04995 2025-11-10 cs.HC cs.AI cs.CL 62%

Enhancing Public Speaking Skills in Engineering Students Through AI

Amol Harsh, Brainerd Prince, Siddharth Siddharth, Deepan Raj Prabakar Muthirayan, Kabir S Bhalla, Esraaj Sarkar Gupta, Siddharth Sahu

机构 * Center for Thinking, Language and Communication(思考、语言与交流中心) Plaksha University(普拉克斯大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15176 2025-11-06 cs.SD cs.CL eess.AS 62%

Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization

Longshen Ou, Jingwei Zhao, Ziyu Wang, Gus Xia, Qihao Liang, Torin Hopkins Ye Wang

机构 * Sound and Music Computing Lab, School of Computing, NUS(新加坡国立大学计算机学院声音与音乐计算实验室) Courant Institute of Mathematical Sciences, New York University(纽约大学应用数学科学学院) Music X Lab, MBZUAI(MBZUAI音乐X实验室)

专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.CL、eess.AS

Comments NeurIPS 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01670 2025-11-04 cs.CL cs.AI 62%

SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia

Chaoqun Liu, Mahani Aljunied, Guizhen Chen, Hou Pong Chan, Weiwen Xu, Yu Rong, Wenxuan Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01261 2025-11-04 cs.SD cs.AI eess.AS 62%

Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play

Jiatong Shi, Jionghao Han, Yichen Lu, Santiago Pascual, Pengfei Wu, Chenye Cui, Shinji Watanabe, Chao Weng, Cong Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Anuttacon(安纳塔康)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 67 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21864 2025-10-28 cs.CL cs.AI 62%

DeepOmni: Towards Seamless and Smart Speech Interaction with Adaptive Modality-Specific MoE

Hang Shao, Heting Gao, Yunhang Shen, Jiawei Chen, Zuwei Long, Dong Yang, Ke Li, Xing Sun

机构 * Tencent(腾讯) Fudan University(复旦大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22088 2025-10-27 cs.SD cs.CL eess.AS 62%

Visual Cues Support Robust Turn-taking Prediction in Noise

Sam O'Connor Russell, Naomi Harte

机构 * ADAPT Centre, School of Engineering(ADAPT中心,工程学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted to INTERSPEECH 2025, 10.21437/Interspeech.2025-668

Journal ref Proc. of INTERSPEECH 2025, 1073--1077, 10.21437/Interspeech.2025-668

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20850 2025-10-27 eess.AS cs.CL cs.SD 62%

Can large audio language models understand child stuttering speech? speech summarization, and source separation

Chibuzor Okocha, Maya Bakri, Christan Grant

机构 * Department of Computer Science, University of Florida, Gainesville, FL, USA(佛罗里达大学计算机科学系) Department of Computer Science, Lebanese American University(黎巴嫩美国大学计算机科学系)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

Comments 7 pages, 1 Figure, 8 tables, Under review ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19671 2025-10-24 cs.SD cs.AI eess.AS 62%

Automated evaluation of children's speech fluency for low-resource languages

Bowen Zhang, Nur Afiqah Abdul Latiff, Justin Kan, Rong Tong, Donny Soh, Xiaoxiao Miao, Ian McLoughlin

机构 * College of Computing \& Data Science

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 5 pages, 2 figures, conference

Journal ref Proc. Interspeech 2025, pp. 1948-1952, 17-21 Aug. 2025, Rotterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19055 2025-10-23 cs.AI cs.SD eess.AS 62%

The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS

Brandon James Carone, Iran R. Roman, Pablo Ripollés

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23670 2025-10-23 cs.SD cs.CL eess.AS 62%

Efficient Interleaved Speech Modeling through Knowledge Distillation

Mohammadmahdi Nouriborji, Morteza Rohanian

机构 * Nlpie Research University of Zurich(Nlpie研究所 瑞士苏黎世大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10444 2025-10-20 cs.CL cs.AI 62%

Do Audio LLMs Really LISTEN, or Just Transcribe? Measuring Lexical vs. Acoustic Emotion Cues Reliance

Jingyi Chen, Zhimeng Guo, Jiyun Chun, Pichao Wang, Andrew Perrault, Micha Elsner

机构 * Department of Linguistics, The Ohio State University, USA(语言学系,俄亥俄州立大学) Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) Department of Information Sciences and Technology, Penn State University, USA(信息科学与技术系,宾夕法尼亚州立大学) Amazon, USA(亚马逊公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12171 2025-10-17 cs.CL cs.AI 62%

Preservation of Language Understanding Capabilities in Speech-aware Large Language Models

Marek Kubis, Paweł Skórzewski, Iwona Christop, Mateusz Czyżnikiewicz, Jakub Kubiak, Łukasz Bondaruk, Marcin Lewandowski

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

Comments 5 pages, 1 figure; benchmark code available at https://github.com/SamsungLabs/C3T

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13351 2025-10-16 cs.CL cs.AI 62%

Protect: Towards Robust Guardrailing Stack for Trustworthy Enterprise LLM Systems

Karthik Avinash, Nikhil Pareek, Rishav Hada

机构 * FutureAGI Inc.(未来人工智能公司)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11732 2025-10-15 cs.SD cs.AI eess.AS 62%

Serial-Parallel Dual-Path Architecture for Speaking Style Recognition

Guojian Li, Qijie Shao, Zhixian Zhao, Shuiyuan Wang, Zhonghua Fu, Lei Xie

机构 * School of Computer Science, Northwestern Polytechnical University(计算机科学学院,西北工业大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

Comments Accepted by NCMMSC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10201 2025-10-14 cs.LG cs.AI cs.CL 62%

RLFR: Extending Reinforcement Learning for LLMs with Flow Environment

Jinghao Zhang, Naishan Zheng, Ruilin Li, Dongzhou Cheng, Zheming Liang, Feng Zhao, Jiaqi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动) Wuhan University(武汉大学) Southeast University(东南大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Project Website: https://jinghaoleven.github.io/RLFR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03639 2025-10-07 cs.CL cs.AI 62%

Towards Unsupervised Speech Recognition at the Syllable-Level

Liming Wang, Junrui Ni, Kai-Wei Chang, Saurabhchand Bhati, David Harwath, Mark Hasegawa-Johnson, James R. Glass

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20467 2025-09-26 cs.CL cs.CV 62%

ShortCheck: Checkworthiness Detection of Multilingual Short-Form Videos

Henrik Vatndal, Vinay Setty

机构 * Factiverse AI University of Stavanger(斯塔万格大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16670 2025-09-23 cs.SD cs.MM eess.AS 62%

Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection

Wenhuan Lu, Xinyue Song, Wenjun Ke, Zhizhi Yu, Wenhao Yang, Jianguo Wei

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国) PipeChina Institute of Science and Technology, Tianjin, China(中石油科技研究院,天津,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12275 2025-09-19 cs.SD cs.AI eess.AS 62%

Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering

Jinghua Zhao, Hang Su, Lichun Fan, Zhenbo Luo, Hui Wang, Haoqin Sun, Yong Qin

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 5 pages, 1 figure, 2 tables submitted to icassp, under prereview

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15871 2025-09-18 cs.CY cs.AI cs.CL 62%

A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare

Manar Aljohani, Jun Hou, Sindhura Kommu, Xuan Wang

机构 * Virginia Tech(维吉尼亚理工大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02844 2025-09-17 cs.CV cs.CL cs.CR 62%

Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection

Ziqi Miao, Yi Ding, Lijun Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to EMNLP 2025 (Main). 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22809 2025-09-08 cs.CL cs.AI cs.HC 62%

First Steps Towards Overhearing LLM Agents: A Case Study With Dungeons & Dragons Gameplay

Andrew Zhu, Evan Osgood, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 5 figures. COLM 2025 Workshop on AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02969 2025-09-04 cs.CV cs.MM cs.SI 62%

VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results

Dasong Li, Sizhuo Ma, Hang Hua, Wenjie Li, Jian Wang, Chris Wei Zhou, Fengbin Guan, Xin Li, Zihao Yu, Yiting Lu, Ru-Ling Liao, Yan Ye, Zhibo Chen, Wei Sun, Linhan Cao, Yuqin Cao, Weixia Zhang, Wen Wen, Kaiwei Zhang, Zijian Chen, Fangfang Lu, Xiongkuo Min, Guangtao Zhai, Erjia Xiao, Lingfeng Zhang, Zhenjie Su, Hao Cheng, Yu Liu, Renjing Xu, Long Chen, Xiaoshuai Hao, Zhenpeng Zeng, Jianqin Wu, Xuxu Wang, Qian Yu, Bo Hu, Weiwei Wang, Pinxin Liu, Yunlong Tang, Luchuan Song, Jinxi He, Jiaru Wu, Hanjia Lyu

机构 * Sizhuo Ma(* 作者单位) Hang Hua(* 作者单位) Wenjie Li(* 作者单位) Jian Wang(* 作者单位) Chris Wei Zhou(* 作者单位) Fengbin Guan(* 作者单位) Xin Li(* 作者单位) Zihao Yu(* 作者单位) Yiting Lu(* 作者单位) Ru-Ling Liao(* 作者单位) Yan Ye(* 作者单位) Zhibo Chen(* 作者单位) Wei Sun(* 作者单位) Linhan Cao(* 作者单位) Yuqin Cao(* 作者单位) Weixia Zhang(* 作者单位) Wen Wen(* 作者单位) Kaiwei Zhang(* 作者单位) Zijian Chen(* 作者单位) Fangfang Lu(* 作者单位) Xiongkuo Min(* 作者单位) Guangtao Zhai(* 作者单位) Erjia Xiao(* 作者单位) Lingfeng Zhang(* 作者单位) Zhenjie Su(* 作者单位) Hao Cheng(* 作者单位) Yu Liu(* 作者单位) Renjing Xu(* 作者单位) Long Chen(* 作者单位) Xiaoshuai Hao(* 作者单位) Zhenpeng Zeng(* 作者单位) Jianqin Wu(* 作者单位) Xuxu Wang(* 作者单位) Qian Yu(* 作者单位) Bo Hu(* 作者单位) Weiwei Wang(* 作者单位) Pinxin Liu(* 作者单位) Yunlong Tang(* 作者单位) Luchuan Song(* 作者单位) Jinxi He(* 作者单位) Jiaru Wu(* 作者单位) Hanjia Lyu(* 作者单位)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments ICCV 2025 VQualA workshop EVQA track

Journal ref ICCV 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21376 2025-09-04 cs.AI cs.CL 62%

AHELM: A Holistic Evaluation of Audio-Language Models

Tony Lee, Haoqin Tu, Chi Heem Wong, Zijun Wang, Siwei Yang, Yifan Mai, Yuyin Zhou, Cihang Xie, Percy Liang

机构 * Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克ruz分校) Hitachi America, Ltd.(日立美国有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16632 2025-08-28 cs.CL cs.SD eess.AS 62%

Step-Audio 2 Technical Report

Boyong Wu, Chao Yan, Chen Hu, Cheng Yi, Chengli Feng, Fei Tian, Feiyu Shen, Gang Yu, Haoyang Zhang, Jingbei Li, Mingrui Chen, Peng Liu, Wang You, Xiangyu Tony Zhang, Xingyuan Li, Xuerui Yang, Yayue Deng, Yechang Huang, Yuxin Li, Yuxin Zhang, Zhao You, Brian Li, Changyi Wan, Hanpeng Hu, Jiangjie Zhen, Siyu Chen, Song Yuan, Xuelin Zhang, Yimin Jiang, Yu Zhou, Yuxiang Yang, Bingxin Li, Buyun Ma, Changhe Song, Dongqing Pang, Guoqiang Hu, Haiyang Sun, Kang An, Na Wang, Shuli Gao, Wei Ji, Wen Li, Wen Sun, Xuan Wen, Yong Ren, Yuankai Ma, Yufan Lu, Bin Wang, Bo Li, Changxin Miao, Che Liu, Chen Xu, Dapeng Shi, Dingyuan Hu, Donghang Wu, Enle Liu, Guanzhe Huang, Gulin Yan, Han Zhang, Hao Nie, Haonan Jia, Hongyu Zhou, Jianjian Sun, Jiaoren Wu, Jie Wu, Jie Yang, Jin Yang, Junzhe Lin, Kaixiang Li, Lei Yang, Liying Shi, Li Zhou, Longlong Gu, Ming Li, Mingliang Li, Mingxiao Li, Nan Wu, Qi Han, Qinyuan Tan, Shaoliang Pang, Shengjie Fan, Siqi Liu, Tiancheng Cao, Wanying Lu, Wenqing He, Wuxun Xie, Xu Zhao, Xueqi Li, Yanbo Yu, Yang Yang, Yi Liu, Yifan Lu, Yilei Wang, Yuanhao Ding, Yuanwei Liang, Yuanwei Lu, Yuchu Luo, Yuhe Yin, Yumeng Zhan, Yuxiang Zhang, Zidong Yang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Heung-Yeung Shum, Jiansheng Chen, Jing Li, Xiangyu Zhang, Yibo Zhu

机构 * StepFun Audio Team(StepFun音频团队)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments v3: Added introduction and evaluation results of Step-Audio 2 mini

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08400 2025-08-28 cs.CL cs.LG cs.SD eess.AS 62%

mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks

Luel Hagos Beyene, Vivek Verma, Min Ma, Jesujoba O. Alabi, Fabian David Schmidt, Joyce Nakatumba-Nabende, David Ifeoluwa Adelani

机构 * AIMS RIC NM-AIST Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind) Saarland University(萨尔兰大学) University of Würzburg(维尔茨堡大学) Makerere University(Makerere大学) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13237 2025-08-26 eess.AS cs.CL cs.SD 62%

SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information

Chih-Kai Yang, Neo Ho, Yen-Ting Piao, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted to Interspeech 2025 (Oral). Update acknowledgement in this version. Project page: https://github.com/ckyang1124/SAKURA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16789 2025-08-26 cs.CV cs.CL 62%

Leveraging the Power of MLLMs for Gloss-Free Sign Language Translation

Jungeun Kim, Hyeongwoo Jeon, Jongseong Bae, Ha Young Kim

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Information, Yonsei University(信息研究生院,延世大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏