arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2607.19352 2026-07-23 cs.HC cs.CY cs.MM cs.SD 新提交 57%

Validating the Single Item Kawaii Measure

验证单项卡哇伊度量

Katie Seaborn, Yijia Wang

机构 * University of Cambridge(剑桥大学) Institute of Science(科学研究院) Tokyo Institute of Technology(东京技术大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 研究测量用户对卡哇伊感知的问题,通过九个数据集对单项度量进行收敛、已知群体和跨情境效度及信度检验,证明了其在声音和视觉卡哇伊感知方面效度的初步证据,并指出可进一步提高严谨性。

Comments Accepted at CUI '26 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17079 2026-07-21 eess.AS 新提交 57%

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

SALMONN-2:利用自监督表示提升通用听力能力

Xiaoyu Yang, Xuenan Xu, Wenyi Yu, Siyin Wang, Changli Tang, Terumi Chiba, Siyuan Hou, Ziyang Zhang, Wen Wu, Baoxiang Li, Guangzhi Sun, Chao Zhang, Philip Woodland

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 研究探索自监督学习音频表示能否为音频大语言模型提供基础,提出基于统一SSL编码器的SALMONN-2,用多层特征融合适配器,还探索多模态上下文学习。实验表明通用SSL编码器性能良好,SALMONN-2达先进水平,且特定训练可获多模态上下文学习能力。

Comments Disclaimer: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17812 2026-07-21 cs.CL 新提交 57%

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

ESCUCHA:用于异构声学条件的西班牙语语音基准测试

Fernando López, Ana Ayala, Guillermo Segovia, Fernando Ibáñez, Ana Martínez, Pablo Gómez, Jordi Luque

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现实声学条件下西班牙语语音理解受关注少的问题,引入ESCUCHA基准测试,含1000个人工挑选与音频配对的问题,强调推理与语言多样性,涵盖多类问题,测试发现先进模型与人类存在性能差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14182 2026-07-17 cs.RO cs.AI 新提交 57%

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

用于动态人形机器人全身控制的语义音频驱动理解

J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

机构 * Sapienza University of Rome(罗马第一大学) International University of Rome(罗马国际大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 研究针对人形机器人自主性和动态环境响应受限问题,提出语义音频驱动的多模态编排框架,通过处理音频流、结合音乐与语音输入及强化学习控制,验证了该方法在模拟和实体机器人上的有效性。

Comments Accepted at 29th Robocup International Symposium, held on July 6th, 2026 in Incheon, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16496 2026-07-16 eess.SY cs.AI cs.LG cs.SY 57%

Synergies between Federated Foundation Models and Smart Power Grids

联邦基础模型与智能电力电网的协同作用

Seyyedali Hosseinalipour, Shimiao Li, Adedoyin Inaolaji, Filippo Malandra, Luis Herrera, Nicholas Mastronarde

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出联邦基础模型与智能电网的协同方法,通过双向视角探讨M3T FedFMs在电网功能增强和模型设计优化中的应用。

Journal ref IEEE Electrification Magazine, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11792 2026-07-14 cs.RO eess.AS 新提交 57%

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

将所有内容都转换为在线 API 服务?关于在机器人系统中集成本地化语音识别模型的综述

Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova

机构 * Institute of Science Tokyo(东京科学研究所) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 综述自动语音识别技术在机器人系统中的集成,涵盖其从传统到深度学习模型的演变、相关数据集与工具包,介绍基于 ASR 模型家族等的部署策略及实际平台,指出挑战与未来方向,助力社交机器人研究人员探索人机交互领域。

Comments accepted in 18th International Conference on Social Robotics (ICSR + ART 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28022 2026-07-14 cs.CV 版本更新 57%

Are DeepFakes Realistic Enough? Exploring Semantic Mismatch as a Novel Challenge

深度伪造是否足够逼真?探索语义不匹配作为新的挑战

Sharayu Nilesh Deshmukh, Kailash A. Hambarde, Joana C. Costa, Hugo Proença, Tiago Roxo

机构 * Instituto de Telecomunicações, Universidade da Beira Interior(电信研究所,贝拉内里大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出新的评估框架,通过引入语义不匹配类别,评估现有模型在面对语义不一致的深度伪造数据时的鲁棒性,并提出语义强化策略提升检测性能。

Comments Added missing FGI results in semantic reinforcement eval (Table 9), showing an architecture-dependent effect. Abstract, contributions, and conclusion revised accordingly. Clarified RARV-SMM/semantic mismatch definition. Corrected SOTA comparison claim (Sec. 4.7). Added code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09095 2026-07-13 cs.SD cs.MM 新提交 57%

Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

用于音频条件音乐游戏关卡建模的基于事件的令牌序列

Ke Zhang, Chu-Hsuan Hsueh, Kokolo Ikeda

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 研究音乐游戏关卡程序生成问题,受基于事件的符号音乐建模启发,提出令牌级序列公式,构建Transformer模型,在事件级评估中优于基线,能系统分析音频对节奏对齐事件预测的支持。

Comments Camera-ready version, published at ICMR 2026

Journal ref Proceedings of the International Conference on Multimedia Retrieval (ICMR '26), June 16-19, 2026, Amsterdam, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08891 2026-07-12 cs.ET cs.AI cs.HC 57%

Designing and Evaluating an AI-enhanced Immersive Multidisciplinary Simulation (AIMS) for Interprofessional Education

设计和评估一种增强人工智能的沉浸式跨学科模拟(AIMS)用于多专业教育

Ruijie Wang, Jie Lu, Bo Pei, Evonne Jones, Jamey Brinson, Timothy Brown

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AIMS通过整合AI和虚拟环境,为多专业教育提供沉浸式模拟,提升学生协作能力和临床推理能力。

Comments 15 pages. Immersive Learning Research-Academic (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12527 2026-07-07 eess.AS 版本更新 57%

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

Audio-Cogito:迈向大型音频语言模型中的深度音频推理

Longhao Li, Hongjie Chen, Zehan Li, Qihan Hu, Jian Kang, Jie Li, Lei Xie, Yongxiang Li

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出Audio-Cogito,通过开发Cogito-pipe数据集和自蒸馏策略,提升音频推理能力,在MMAR基准和Interspeech 2026挑战中表现优异。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02343 2026-07-03 cs.SD cs.AI 新提交 57%

SelectTSL: Prompt-Guided Selective Target Sound Localization in Complex Scenarios

SelectTSL:复杂场景中提示引导的选择性目标声音定位

Ziyang Jiang, Yu Chen, Zexu Pan, Xinyuan Qian, Bowen Xing, Ivor W. Tsang, Xu-Cheng Yin, Haizhou Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SelectTSL架构,通过提示引导的选择性注意力模块增强相位差,实现多源声场中仅定位用户指定目标,并估计到达方向和目标源数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10231 2026-07-03 eess.AS cs.SD 新提交 57%

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling

LLM 能读频谱图:无编码器的语音语言建模

Ruchao Fan, Yiming Wang, Yuxuan Hu, Bo Ren, Yufei Xia, Xiaofei Wang, Yao Qian, Shujie Liu, Jinyu Li

机构 * Microsoft, USA(微软公司,美国)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 提出 Mel-LLM,一种无需专用语音编码器、直接将梅尔频谱图补丁通过线性投影输入 LLM 的架构,在 ASR 和 TTS 任务上验证了其可行性,ASR 性能与有编码器方案相当,TTS 初步可行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 57%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30294 2026-06-30 cs.AI cs.HC cs.SE 57%

Rehearsed Multi-Agent Live Product Demonstrations with Real-Time Voice Question Answering

排练式多智能体实时语音问答产品演示

Rahul Khedar, Mayank Malhotra, Avinash Karn, Mouli V, Prakhar Mehrotra

机构 * PayPal AI

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出多智能体系统Rhetor,通过跨模态特征表示、接地脚本、排练循环和运行时同步,实现带语音问答的实时产品演示自动化。

Comments Preprint. 4 figures, 1 algorithm, 5 tables. Systems paper with a preliminary six-session case study on four deployed applications; full benchmark protocol proposed, corpus run to appear in a later revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03283 2026-06-30 eess.AS cs.SD 57%

SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification

SpeakerCard-1M:面向野外说话人确认的基于证据的说话人卡片语料库

Junyi Peng, Oldřich Plchot, Xiao Song, Dading Chong, Lichun Fan, Hang Su, Themos Stafylakis, Junjie Li, Kong Aik Lee, Shuai Wang, Jian Luan, Jan Černocký

机构 * Brno University of Technology, Czechia(布拉格技术大学,捷克) Peking University, China(北京大学,中国) Xiaomi, China(小米,中国) Athens University of Economics and Business, Greece(雅典经济与商业大学,希腊) The Hong Kong Polytechnic University, Hong Kong(香港理工大学,香港) Nanjing University, China(南京大学,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 提出SpeakerCard-1M双语说话人资源,通过声学探针和受限LLM生成结构化说话人卡片,并定义跨模态协议以支持基于证据的说话人确认。

Comments Corpus and protocols at https://junyipeng00.github.io/SpeakerCard-1M-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27627 2026-06-29 cs.LG cs.AI 新提交 57%

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

HybridCodec:为高效语音语言模型建模离散和连续表示

Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

机构 * Mila, Quebec AI Institute(Mila-魁北克人工智能研究所) Concordia University(康考迪亚大学) Sapienza University of Rome(罗马大学) Inria, Université Grenoble Alpes CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学国家科学研究中心,让·库尔曼实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出HybridCodec,结合时间压缩离散令牌与降维连续残差,通过混合离散-连续焦点调制编解码器和混合Transformer,在离散域自回归推理并辅以非自回归预测和连续残差上采样,相比纯离散方法显著提升说话人特征保留并减少自回归步数。

Comments Accepted

Journal ref InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27380 2026-06-29 cs.CL 新提交 57%

A Survey of Automated Presentation Coaching: Systems, Methods, and Open Challenges

自动演讲辅导系统综述:系统、方法与开放挑战

Wen Liang, Li Siyan, Zackary Rackauckas, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司) RoleGaku

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文综述自动演讲辅导系统,提出五维任务分类法,覆盖发音、韵律、节奏和内容忠实度,并分析TTS示例生成与诊断方法,指出语料稀缺、口音公平和低延迟诊断等挑战。

Comments accepted into the BEA 2026 workshop at ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26793 2026-06-26 cs.CR cs.AI cs.LG 新提交 57%

MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG

MIRROR: 基于新颖性约束的记忆引导MCTS红队测试用于智能体RAG

Inderjeet Singh, Andrés Murillo, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, United Kingdom(欧洲富士通研究机构,英国) Fujitsu Limited, Japan(日本富士通有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出MIRROR框架,通过记忆引导蒙特卡洛树搜索和显式新颖性约束,在多模态智能体RAG系统的四个攻击面上实现高攻击成功率,并降低跨表面方差。

Comments 6 pages, 2 figures. Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026), IEEE WCCI 2026; presented as an oral talk. Code and ART-SafeBench benchmark: https://github.com/FujitsuResearch/mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08660 2026-06-26 cs.CL 版本更新 57%

A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models

预训练语言模型时代语义角色标注的系统综述

Huiyao Chen, Meishan Zhang, Jing Li, Lilja Øvrelid, Jan Hajič, Hao Fei, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳南山区研究院) University of Oslo(奥斯陆大学) Charles University(查尔斯大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出四维分类法系统综述SRL研究,分析句法特征的作用条件,首次系统处理大语言模型时代的SRL,并扩展至多模态设置。

Comments 54 pages, 9 figures, 9 tables. Accepted at Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06080 2026-06-26 cs.CV cs.CY cs.HC 版本更新 57%

AIDEN: Design and Pilot Study of an AI Assistant for the Visually Impaired

AIDEN:面向视障人士的AI助手设计与初步研究

Luis Marquez-Carpintero, Francisco Gomez-Donoso, Zuria Bauer, Bessie Dominguez-Dager, Alvaro Belmonte-Baeza, Mónica Pina-Navarro, Francisco Morillas-Espejo, Felix Escalona, Miguel Cazorla

机构 * Institute for Computer Research, University of Alicante(计算机研究所,阿利坎特大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出AIDEN系统,结合YOLO实时目标检测、LLaVA场景描述与OCR,以及基于盖革计数器隐喻的连续触觉引导,避免听觉过载并保护隐私,实验表明用户满意度高。

Journal ref IEEE Access 14 (2026) 80406-80420

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04109 2026-06-25 cs.HC cs.AI 版本更新 57%

Tinker Tales: A Tangible Dialogue System for Child-AI Co-Creative Storytelling

Tinker Tales:一个用于儿童与AI共同创意故事讲述的有形对话系统

Nayoung Choi, Jiseung Hong, Peace Cyebukayire, Ikseon Choi, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) School of Nursing, Emory University(埃默里大学护理学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出Tinker Tales有形对话系统,通过结合物理故事板、NFC玩具和移动应用,支持儿童与AI在四个叙事阶段进行协作故事创作,并发现提示框架影响儿童叙事贡献的形式和一致性。

Comments Accepted to SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19914 2026-06-19 cs.RO cs.AI 新提交 57%

Co-policy: Responsive Human-Robot Co-Creation for Musical Performances

Co-policy: 响应式人机音乐共创框架

Xuetao Li, Wenke Huang, Mang Ye, Zijian Liu, Jinhua Xie, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Automation, Wuhan University of Technology(武汉理工大学自动化学院) School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出Co-policy框架,通过语义锚定、约束变分和视觉运动策略实现人机音乐实时共创,在真实钟琴实验中优于扩散策略基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14784 2026-06-19 cs.SD cs.LG eess.AS 新提交 57%

LLM-Based Synthetic Ground Truth Generation for Audio-Based Emotion Classification via In-Context Learning

基于上下文学习的音频情感分类的LLM合成真实标签生成

Qing Huang, Pooja Pol, Jianing Zhang

机构 * School of Business, Technical University of Applied Sciences Augsburg(应用技术大学阿沙芬堡商学院) Data Science und Autonome Systeme Technologietransferzentrum (TTZ)(数据科学与自主系统技术转移中心(TTZ))

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 提出利用大语言模型(LLM)和上下文学习(ICL)从多用户VR环境的流式语音数据中自动生成情感相关合成真实标签,解决团队协作状态标注难题。

Comments https://icaiit.org/paper.php?paper=14th_ICAIIT_2/3_9

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18726 2026-06-19 cs.SD cs.LG eess.AS 版本更新 57%

Bioacoustic Geolocation: Species Sounds as Geographic Signals

生物声学地理定位:物种声音作为地理信号

Mustafa Chasmai, Wuao Liu, Subhransu Maji, Grant Van Horn

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究仅通过声音进行全球尺度地理定位,利用生物声学信号中的物种地理分布线索,提出结合物种范围预测与检索的地理定位方法,并验证多模态融合的潜力。

Comments Accepted to ICML 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18266 2026-06-18 cs.HC cs.AI cs.SD 新提交 57%

EMORSION: Examining the Impact of Audio Parameters on Emotional Responses and Immersion in Film

EMORSION:检验音频参数对电影中情感反应和沉浸感的影响

Nelly Garcia, Ruby Crocker, Bleiz M Del Sette, Fabrizio Smeraldi, Charalampos Saitis, George Fazekas, Joshua Reiss

机构 * Queen Mary University of London(伦敦大学女王学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 通过操纵频率、动态和方向性三个音频参数,研究电影音频设计对观众情感和沉浸感的影响,发现细微变化可改变情感感知,非常规混音增加解读变异性。

Comments AES Europe 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26672 2026-06-18 cs.MM cs.SD 版本更新 57%

Can We Hear from Events? Generating Speech from Event Camera

我们能从事件中听到声音吗?从事件相机生成语音

Jingping Fang, Lin Chen, Chenyang Xu, Tong Zhao, Weidong Cai, Xiaoming Chen

机构 * Beijing Technology and Business University(北京技术与商业大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Sydney(悉尼大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 提出EventSpeech框架,利用神经形态事件相机的高时间精度解决传统RGB语音生成中的时间粒度不匹配问题,实现情感丰富且抗运动模糊的语音生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22363 2026-06-18 cs.LG eess.AS 版本更新 57%

Investigating Faithfulness in Large Audio Language Models

大型音频语言模型中的忠实性研究

Pooneh Mousavi, Lovenya Jain, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(康科迪亚大学) Mila - Quebec AI Institute(魁北克人工智能研究院) Université Laval(拉瓦尔大学) Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,皮兰尼)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 提出系统框架评估大型音频语言模型在推理链忠实性上的表现,定义三个音频忠实性标准,并通过基准测试发现模型推理与音频输入存在脱节。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16009 2026-06-17 cs.CL cs.HC 新提交 57%

Bridging the Usability Gap: Lessons from Interpreting Studies for Machine Interpreting Design

弥合可用性差距:口译研究对机器口译设计的启示

Claudio Fantinuoli

机构 * University of Mainz(美因茨大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文定义机器口译为语音翻译的子领域,指出其存在“准确性幻觉”,并借鉴口译研究提出未来设计的三个优先方向:能动性、共同基础与体验,以弥合可用性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16539 2026-06-16 eess.AS cs.SD 新提交 57%

Decoding while Adapting: Zero-Shot Online Speaker Adaptation via Audio-Textual Prompts for Elderly Speech Recognition

解码与自适应:基于音频-文本提示的零样本在线说话人自适应用于老年人语音识别

Chengxi Deng, Xurong Xie, Shujie Hu, Mengzhe Geng, Tianzi Wang, Youjun Chen, Huimeng Wang, Haoning Xu, Jiajun Deng, Xunying Liu

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Institute of Software, Chinese Academy of Sciences, China(中国科学院软件研究所) National Research Council Canada, Canada(加拿大国家研究理事会)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 提出一种基于跨语句音频-文本提示的说话人自适应方法,实现零样本实时适应未见说话人,在老年人语音数据集上显著降低词错误率/字符错误率,并大幅提升实时因子。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16472 2026-06-16 cs.CL 新提交 57%

From Awareness to Adherence: Bridging the Context Gap in Spoken Dialogue Systems via Context-Aware Decoding

从意识到遵循:通过上下文感知解码弥合口语对话系统中的上下文鸿沟

Che Hyun Lee, Heeseung Kim, Sungroh Yoon

机构 * ECE, Seoul National University(首尔大学电气与计算机工程系) IPAI, Seoul National University(首尔大学IPAI研究所) Department of AI, University of Seoul(首尔市立大学人工智能系)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出音频适配的上下文感知解码方法,通过对比有无关键上下文的输出分布,放大多模态上下文信号,解决口语对话系统中上下文遵循问题。

Comments Interspeech 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏