arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2607.12290 2026-07-15 eess.AS cs.AI cs.CL cs.LG cs.SD 新提交 67%

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

缺失之音:音频-语言嵌入模型在处理否定时存在困难

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(国家台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(国家台湾大学人工智能卓越研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 研究音频-语言嵌入模型在处理否定时的问题,引入NegEval-Audio框架将数据集转换为否定感知任务,发现模型在否定情况下性能大幅下降,肯定偏差是缺陷,需明确否定感知训练目标。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11120 2026-07-14 cs.CV cs.CL eess.AS 新提交 67%

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

视频中矛盾与犹豫识别的简单特征与诚实校准

Vikas Kumar, Aditya Mishra, Haroon R. Lone

机构 * Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS

AI总结 针对ABAW 2026 BAH挑战赛中的矛盾与犹豫识别问题,系统结合情感专用多模态表示与语言犹豫线索,经AMF融合及AP加权集成。引入‘ASR擦除时间’构建特征,实验表明语言是最强通道,校准比架构重要,固定阈值AP加权测试集得分0.731。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22378 2026-07-14 cs.SD cs.AI cs.MM eess.AS 67%

Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach

零努力图像到音乐生成:一种可解释的基于RAG的视觉语言模型方法

Zijian Zhao, Dian Jin, Zijing Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学) The Hong Kong University of Science(香港科学大学) The Hong Kong Polytechnic University Hong Kong China(香港理工大学香港中国) The University of Hong Kong Hong Kong China(香港大学香港中国)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出一种基于RAG的视觉语言模型方法,实现图像到音乐生成,通过ABC记谱法连接文本与音乐模态,并利用多模态检索增强生成和自反思技术,提供高可解释性且低计算成本的音乐生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05196 2026-07-08 cs.CL cs.AI cs.LG cs.SD eess.AS 新提交 67%

Unified Audio Intelligence Without Regressing on Text Intelligence

不退化文本智能的统一音频智能

Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。

Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02504 2026-07-03 cs.CL cs.AI cs.CV 新提交 67%

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

推理大模型提升长篇电视剧中的说话人识别

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出DramaSR-532K大规模基准和基于推理大模型的DramaSR-LRM方法,通过多模态工具使用聚合上下文证据,显著提升长篇电视剧中说话人识别准确率,尤其对短话语效果显著。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09803 2026-07-01 cs.SD 版本更新 67%

MAGE: Modality-Agnostic Music Generation and Target-Source Extraction

MAGE:模态无关的音乐生成与编辑

Muhammad Usama Saleem, Tejasvi Ravi, Tianyu Xu, Rajeev Nongpiur, Ishan Chatterjee, Mayur Jagdishbhai Patel, Pu Wang

机构 * Google(谷歌) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 MAGE提出了一种模态无关框架,统一了多模态音乐生成与混合编辑,通过可控多模态FluxFormer和音频视觉 nexus 对齐机制,实现灵活且高效的音乐生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04840 2026-06-24 eess.AS cs.AI cs.CL 版本更新 67%

An Approach to Simultaneous Acquisition of Real-Time MRI Video, EEG, and Surface EMG for Articulatory, Brain, and Muscle Activity During Speech Production

一种用于言语产生过程中发音、大脑和肌肉活动的实时MRI视频、脑电图和表面肌电图同步采集方法

Jihwan Lee, Parsa Razmara, Kevin Huang, Sean Foley, Aditya Kommineni, Haley Hsu, Woojae Jeong, Prakash Kumar, Xuan Shi, Yoonjeong Lee, Tiantian Feng, Takfarinas Medani, Ye Tian, Sudarsana Reddy Kadiri, Krishna S. Nayak, Dani Byrd, Louis Goldstein, Richard M. Leahy, Shrikanth Narayanan

机构 * Signal Analysis and Interpretation Laboratory, University of Southern California(南加州大学信号分析与解释实验室) Ming Hsieh Dept. of Electrical and Computer Engineering, University of Southern California(南加州大学明希斯电气与计算机工程系) Dept. of Linguistics, University of Southern California(南加州大学语言学系)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文首次实现了言语产生过程中实时MRI、EEG和表面EMG的同步采集,并提出了针对三模态设置的伪影抑制流程,为言语神经科学和脑机接口提供新视角。

Comments Accepted for Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06191 2026-06-23 eess.AS cs.AI cs.CL cs.SD 版本更新 67%

Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment

Harf-Speech:面向阿拉伯语音素级语音评估的临床对齐框架

Asif Azad, MD Sadik Hossain Shanto, Mohammad Sadat Hossain, Bdour Alwuqaysi, Sabri Boughorbel, Yahya Bokhari, Abdulrhman Aljouie, Ayah Othman Sindi, Ehsan Hoque

机构 * Ministry of Defense, Saudi Arabia(沙特阿拉伯国防部) Ability Center, Saudi Arabia(沙特阿拉伯能力中心) University of Rochester, USA(罗切斯特大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出Harf-Speech模块化系统,结合MSA音素化器、微调语音到音素模型、Levenshtein对齐及混合评分器,在阿拉伯语音素级发音评估中达到0.791 Pearson相关和0.659 ICC,优于现有端到端方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21182 2026-06-15 cs.CL cs.AI cs.CV 版本更新 67%

Manga109-v2026: Revisiting Manga109 Annotations for Modern Manga Understanding

Manga109-v2026: 重新审视Manga109标注以适应现代漫画理解

Jeonghun Baek, Atsuyuki Miyai, Shota Onohara, Hikaru Ikuta, Kiyoharu Aizawa

机构 * University of Tokyo(东京大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文重新审视Manga109的对话文本标注,识别出五类标注问题,包括转录错误、缺失文本区域、对话与拟声词重叠以及未分割的对话气泡,并通过结合OCR基于的问题检测和人工修订构建Manga109-v2026,修订了约29,000个对话标注,使Manga109更好地适应现代OCR和多模态漫画理解系统,同时保留漫画特有的表达结构。

Comments Accepted to the Culture x AI Workshop at ICML 2026. Project page: https://manga109.github.io/manga109-project-website/en/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10010 2026-06-10 eess.AS cs.AI cs.MM cs.SD 新提交 67%

DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment

DeRA-MOS:通过解耦列表排序和模态对齐优化文本到音乐评估

Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen

机构 * E.SUN Financial Holding Co., Ltd.(E.SUN财务控股公司) United Link Co., Ltd.(联合链接有限公司) Institute of Information Science, Academia Sinica(学术院信息科学研究所) Department of Computer Science and Information Engineering, National Taiwan Normal University(台湾师范大学计算机科学与信息工程系)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 提出DeRA-MOS解耦优化框架,通过批感知列表排序损失和分数锚定模态对齐损失,分别优化音乐印象和文本对齐的排名指标,在MusicEval上显著提升评估性能。

Comments Accepted to IEEE Signal Processing Letters (SPL)

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.07347 2026-06-04 eess.SY cs.SY 67%

Dynamical Systems On Weighted Lattices: General Theory

带权晶格上的动力系统:一般理论

Petros Maragos

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 本文提出了一种统一多种非线性离散时间动力系统的方法,这些系统满足加权最大或最小类型的叠加,研究了在带权晶格上的状态和输入输出信号演变,以及非线性卷积、非线性矩阵方程求解、稳定性与可控性等问题,并探讨了其在非线性滤波、动态规划、最短路径、模糊马尔可夫链及多模态信息流中显著事件跟踪等应用。

Comments 38 pages, 4 figures

Journal ref Math. Control Signals Syst. (2017) 29: 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25773 2026-06-02 cs.CV cs.AI cs.CL 67%

v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound

v-HUB: 从视觉和声音理解视频幽默的基准

Zhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang, Qinrong Cui, Wei Bi, Songchun Zhu, Bo Zhao, Zilong Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出v-HUB基准,通过非语言短视频评估多模态大语言模型在仅凭视觉线索理解幽默的能力,并发现音频信息有助于提升幽默理解。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18614 2026-06-02 cs.CL cs.LG cs.MM cs.SD eess.AS 67%

MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song Translation

MAVL:面向动画歌曲翻译的多语言音视频歌词数据集

Woohyun Cho, Youngmin Kim, Sunghyun Lee, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM、eess.AS

AI总结 提出首个多语言多模态歌词翻译基准MAVL,并设计音节约束的音视频大语言模型SylAVL-CoT,利用音视频线索和音节约束提升歌词可唱性和翻译准确性。

Comments Accepted to EMNLP 2025, Project Page: https://k1064190.github.io/papers/paper1.html, our codes and datasets are available at https://github.com/k1064190/MAVL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11042 2026-05-15 cs.CV cs.AI cs.LG cs.MM cs.SD 67%

V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation

V2M-Zero:零配对时间对齐视频到音乐生成

Yan-Bo Lin, Jonah Casebeer, Long Mai, Aniruddha Mahapatra, Gedas Bertasius, Nicholas J. Bryan

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 V2M-ZERO通过解耦的时间同步和语义控制生成与视频事件时间对齐的音乐,无需训练数据,实现更高质量的音频生成和语义对齐。

Comments Project page: https://genjib.github.io/v2m_zero/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09272 2026-05-12 cs.AI cs.CL cs.CV 67%

Towards Conversational Medical AI with Eyes, Ears and a Voice

面向有眼睛、耳朵和声音的对话式医疗AI

Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出AI co-clinician系统,利用音频视频数据实现实时临床决策,通过TelePACES评估标准显示其在管理计划和诊断差异方面接近医生,但在体格检查和疾病特异性推理上仍有不足。

Comments Video examples are available on Youtube: https://youtu.be/y5Vaa_SN1t0, https://youtu.be/dC4icb75vLQ, and https://youtu.be/E7iEvWo-E6c

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25591 2026-04-29 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

穿越不确定性:音频感知大语言模型不确定性估计的实证研究

Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文研究了音频感知大语言模型的不确定性估计,通过多种方法对比发现语义层面方法在通用音频推理中表现更优,且在可靠性导向任务中效果依赖模型和基准。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11110 2026-04-29 cs.SD 67%

Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan

Ti-Audio:首个多方言端到端藏语语音大模型

Jialing Wang, Yue Zhao, Yuhao Zhang, Jing Yu, Shaosai Li, Zhanchen Dai, Benyou Wang, Haizhou Li

机构 * Minzu University of China(中国民族大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出Ti-Audio,首个多方言端到端藏语语音大模型,通过动态Q-Former适配器和温度采样策略解决低资源多方言环境下的语音识别与翻译问题,实验显示其在藏语基准测试中达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03525 2026-04-28 cs.CL cs.AI eess.AS 67%

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

基于语音的认知筛查:大型语言模型适应策略的系统评估

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Haghbin, Hossein AzadMaleki, Maryam Zolnoori

机构 * Columbia University Irving Medical Center(哥伦比亚大学伊文思医疗中心) School of Nursing, Columbia University(哥伦比亚大学护理学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文系统评估了大型语言模型在痴呆症检测中的适应策略,发现上下文学习、推理增强提示和参数高效微调等方法对模型性能有显著影响,展示了适配模型在语音筛查中的有效性。

Journal ref https://ai.jmir.org/2026/1/e82608

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24470 2026-04-17 cs.CV cs.AI cs.CL cs.SI 67%

Counting Without Numbers and Finding Without Words

不使用数字进行计数和不使用词语进行寻找

Badri Narayana Patro

机构 * Microsoft(微软)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出首个多模态重聚系统,整合视觉和声学生物特征,通过处理不同频率的动物声音和容忍压力导致的外观变化,实现基于生物通信原理的AI应用,帮助无语言能力的弱势群体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23435 2026-04-09 cs.SD cs.AI cs.MM eess.AS 67%

AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models

AudioRole: 一个用于大型语言模型角色扮演的音频数据集

Wenyu Li, Xiaoqi Jiao, Yi Chang, Guangyan Zhang, Yiwen Guo

机构 * Westlake University(西湖大学) Tencent LIGHTSPEED STUDIOS(腾讯LIGHTSPEED STUDIOS) Independent Researcher(独立研究员)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出AudioRole数据集,通过13部电视剧1000+小时的100万+角色对话,提供同步音频文本对及角色身份标注,结合ARP-Eval评估框架,验证了GLM-4-Voice在角色扮演中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26246 2026-03-30 cs.CL cs.AI cs.LG eess.AS 67%

Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR

对话蒸馏:用于基于LLM的ASR的对话音频上下文抽象压缩

Shashi Kumar, Esaú Villatoro-Tello, Sergio Burdisso, Kadri Hacioglu, Thibault Bañeras-Roux, Hasindri Watawana, Dairazalia Sanchez-Cortes, Srikanth Madikeri, Petr Motlicek, Andreas Stolcke

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文研究了多模态上下文对基于LLM的ASR的提升效果及高效表示方法,提出抽象压缩技术以减少先前对话的音频负载,实验证明其在领域内和领域外数据集上均有效。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20476 2026-03-25 cs.CV cs.MM eess.AS eess.IV 67%

Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio

迈向包容性沟通:一种统一框架,用于从手语、唇形和音频生成口语语言

Jeong Hun Yeo, Hyeongseop Rha, Sungjune Park, Junil Won, Yong Man Ro

机构 * Integrated Vision Language Laboratory, School of Electrical Engineering, Korea Advanced Institue of Science and Technology (KAIST)(整合视觉语言实验室,电气工程学院,韩国科学技术院(KAIST))

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文提出首个统一框架,整合手语、唇形和音频生成口语文本,探索多模态协同作用,提升手语翻译性能。

Comments Updated the professional title of the corresponding author. Added an Acknowledgement section

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14922 2026-03-24 cs.AI cs.CL cs.LG eess.AS eess.SP 67%

TRI-DEP: A Trimodal Comparative Study for Depression Detection Using Speech, Text, and EEG

TRI-DEP:一种利用语音、文本和EEG进行抑郁症检测的三模态比较研究

Annisaa Fitri Nurfidausi, Eleonora Mancini, Paolo Torroni

机构 * DISI, University of Bologna, Italy(博洛尼亚大学DISI学院,意大利)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文通过系统比较语音、文本和EEG的三模态方法,验证了多模态检测的有效性,发现预训练嵌入优于手工特征,三模态模型达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20433 2026-03-24 cs.SD cs.AI cs.CL eess.AS 67%

ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability

ALICE:大型音频-语言模型上下文学习能力的多维评估框架

Yen-Ting Piao, Jay Chiehen Liao, Wei-Tang Chien, Toshiki Ogimoto, Shang-Tse Chen, Yun-Nung Chen, Chun-Yi Lee, Shao-Yuan Lo

机构 * National Taiwan University, Taiwan(台湾国立成功大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出ALICE框架,通过三阶段评估六个LALMs在音频条件下的上下文学习能力,发现上下文示例虽能提升格式合规性,但难以改善核心任务表现,揭示了跨模态整合的潜在局限。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19831 2026-03-23 eess.AS cs.AI cs.MM 67%

Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?

Gesture2Speech: 手部动作能多大程度上塑造表现性语音?

Lokesh Kumar, Nirmesh Shah, Ashishkumar P. Gudmalwar, Pankaj Wasnik

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出Gesture2Speech框架,利用视觉手势线索调节合成语音的语调,通过多模态MoE架构动态融合语言内容和手势特征,提升语音自然度和手势与语调的同步性。

Comments Accepted at The 2nd International Workshop on Bodily Expressed Emotion Understanding (BEEU) at AAAI 2026 [non-archival]

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14636 2026-03-17 cs.SD cs.AI cs.CL eess.AS 67%

Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

引导隐藏状态:用于大音频-语言模型链式推理的无训练模型引导

Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng, Hung-yi Lee

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 研究通过无训练的模型引导方法提升大音频-语言模型的推理能力,采用多种信息源策略在四个模型和四个基准上进行评估,结果显示推理准确率提升达4.4%,并发现跨模态迁移效应。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16917 2026-03-17 cs.SD cs.AI cs.CL eess.AS 67%

SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models

SAKE:迈向大型音频-语言模型的听觉属性知识编辑

Chih-Kai Yang, Yen-Ting Piao, Tzu-Wen Hsu, Szu-Wei Fu, Zhehuai Chen, Ke-Han Lu, Sung-Feng Huang, Chao-Han Huck Yang, Yu-Chiang Frank Wang, Yun-Nung Chen, Hung-yi Lee

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出SAKE基准,用于评估大型音频-语言模型中听觉属性知识的编辑方法,发现多数方法在可靠性上表现良好,但在听觉泛化和多模态知识传播方面存在不足,细调模态连接器比直接编辑LLM更稳健。

Comments Work in progress. Resources: https://github.com/ckyang1124/SAKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06195 2026-03-11 cs.CL cs.AI cs.LG eess.AS 67%

Latent Speech-Text Transformer

潜在语音-文本变换器

Yen-Ju Lu, Yashesh Gaur, Wei Zhou, Benjamin Muller, Jesus Villalba, Najim Dehak, Luke Zettlemoyer, Gargi Ghosh, Mike Lewis, Srinivasan Iyer, Duc Le

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 潜在语音-文本变换器通过聚合语音标记为潜在块,提升计算效率并改善跨模态对齐,实现语音和文本性能的双重提升。

Comments Accepted to ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13632 2026-02-24 cs.CL cs.AI eess.AS 67%

Closing the Gap Between Text and Speech Understanding in LLMs

弥合语言模型中文本与语音理解之间的差距

Santiago Cuervo, Skyler Seto, Maureen de Seyssel, Richard He Bai, Zijin Gu, Tatiana Likhomanenko, Navdeep Jaitly, Zakaria Aldeneh

机构 * Université de Toulon, Aix Marseille Université, CNRS, LIS(法国图卢兹大学、马赛大学、CNRS、LIS)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SALAD通过主动选择和跨模态蒸馏提高语音与文本对齐,以更高效的方式弥合LLMs在语音理解上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05705 2026-02-18 cs.CV cs.AI cs.CL 67%

Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale

长 grounded 思考:大规模合成视觉问题和推理链

David Acuna, Chao-Han Huck Yang, Yuntian Deng, Jaehun Jung, Ximing Lu, Prithviraj Ammanabrolu, Hyunwoo Kim, Yuan-Hong Liao, Yejin Choi

机构 * nvidia(NVIDIA公司) uoft(多伦多大学) uwaterloo(滑铁卢大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种大规模合成视觉问题和推理链的框架,通过生成高质量数据集提升多模态推理性能,验证了其在视觉、文本和音频任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏