arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 235 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 235 篇

2608.11551 2026-08-13 cs.IT math.IT 新提交 50%

Semantic Error Control Coding with Foundation Models for Future Communications

面向未来通信的、基于基础模型的语义差错控制编码

Chentao Yue, Gaoyang Pang, Branka Vucetic, Yonghui Li

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出基于基础模型的语义差错控制编码(SECC)框架,将信源语义结构融入编解码,在AWGN信道上较传统解码获数分贝编码增益,错误率低于正态近似界,同时指出相关开放挑战。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06633 2026-08-10 cs.SD 新提交 50%

Frame-Level Pansori Mode Classification with Complementary Audio Representations

基于互补音频表示的帧级盘索里调式分类

Sangheon Park, Seonguk Ju, Suin Chung, Danbinaerin Han, Dasaem Jeong

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本研究针对韩国传统声乐盘索里,采用46小时帧级标注与4种互补音频表示,构建调式分类模型,验证其学习调式特征而非记忆曲目,揭示了源分离对线索的影响及预训练的局限性。

Comments Accepted to the 27th International Society for Music Information Retrieval (ISMIR) Conference, 2026

Journal ref ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03040 2026-08-05 cs.SD 新提交 50%

Calliphony: A Calligraphy-Driven Interface for Real-Time Generative Music Performance

Calliphony:一种用于实时生成式音乐表演的书法驱动界面

Tristan Wu, Ruiji Yu, Gus Xia

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 该研究提出书法驱动的实时生成式音乐表演界面Calliphony,构建低延迟流水线捕捉毛笔运动映射为控制信号,实现多轨MIDI生成,将书法扩展为视听AI辅助表演场景,为现场音乐表演提供新方式。

Comments 6 pages, 4 figures. Published in the Proceedings of the International Conference on New Interfaces for Musical Expression (NIME 2026). The first two authors contributed equally

Journal ref Proceedings of the International Conference on New Interfaces for Musical Expression (NIME 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02219 2026-08-04 cs.SD 新提交 50%

Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art

声音画布:将算法嵌入网络化、具感官的声音艺术中

Luciano Ciamarone, Dora Motèque, Marco Giordano

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究将算法嵌入声音艺术装置,通过离线视觉-声音映射与在线模型实现触摸响应的多模态交互,引发算法艺术相关问题。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01785 2026-08-04 cs.DC 新提交 50%

HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving

HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统

Yuning Zhang, Dong Yuan

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21944 2026-07-27 cs.HC 新提交 50%

VisionPulse: A Virtual Reality System Enabling Accessible Discovery and Navigation for Blind and Low Vision Users

VisionPulse:一个为盲人和低视力用户实现无障碍发现与导航的虚拟现实系统

Samuel Martin, Pooyan Fazli, Hasti Seifi

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对盲人和低视力用户在VR中自由探索受限的问题,提出VisionPulse系统,让用户通过自然动作和多模态反馈探索虚拟环境,经实验验证该系统受用户青睐,为包容性VR设计提供了参考。

Comments accepted to ACM ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21550 2026-07-24 cs.LG 新提交 50%

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20938 2026-07-24 cs.IR 新提交 50%

Controllable and Content-Based Recommendations

可控且基于内容的推荐

Fırat Öncel, Jihoon Jeong, Emiliano Penaloza, Mirco Ravanelli, Laurent Charlin, Cem Subakan

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对传统推荐系统难以解释和控制的问题,提出CCBR框架,基于文本用户简档表示构建推荐,通过文本瓶颈引入可控性,能实现多模态干预,在多数据集上有竞争力且优于基线,证明了用户引导机制有效。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19434 2026-07-23 cs.SD 新提交 50%

CAPS: A Cascaded Reconstruction Model to Power Saving in Hearables Using Sub-Nyquist Sampling with Bandwidth Extension

CAPS:一种使用带带宽扩展的亚奈奎斯特采样实现可穿戴设备节能的级联重建模型

Tarikul Islam Tamiti, Sajid Fardin Dipto, Luke Baja-Ricketts, David Vergano, Anomadarshi Barua

机构 * George Mason University(乔治梅森大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究可穿戴设备中联合降低ADC采样比特分辨率和频率对功耗及音频质量的影响,提出CAPS模型,采用亚奈奎斯特采样和低比特分辨率,降低功耗3.3倍,支持移动平台流操作,确保语音清晰度,平衡效率与节能。

Comments arXiv admin note: substantial text overlap with arXiv:2506.22321

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10494 2026-07-14 cs.SE 新提交 50%

Question Answering for Diagram-Rich Technical Meeting Videos

面向富含图表的技术会议视频的问答

Zhuoran Xu, Jia Li, Dayuan Tan, Mark Cole, Ish Ashraf, Sandeep Puri, Mehrdad Sabetzadeh, Shiva Nejati

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究面向富含图表的技术会议视频的问答问题,核心方法是开发基于大语言模型的多模态问答系统LMVQA,主要贡献是显著提高答案准确性,降低响应时间和成本,获领域专家认可。

Comments Accepted for publication in ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08912 2026-07-13 cs.HC 新提交 50%

MemeBuddy: Dialog-Style Audio Representations for Engaging Non-Visual Meme Experiences

MemeBuddy:用于引人入胜的非视觉表情包体验的对话式音频表示

Chirag Bhansali, Vikas Ashok, Hae-Na Lee

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对盲人用户无法充分理解表情包的问题,提出MemeBuddy系统,将表情包建模为对话,结合文本与多模态大语言模型隐含知识生成音频表示。用户研究表明,该方式能提升盲人用户参与度与满意度,且理解能力相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08800 2026-07-13 cs.SD 新提交 50%

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

双BEATs:通过抖动在音频大语言模型中解锁零样本立体声音频感知

Shuo-Chun Lin, Hen-Hsen Huang

机构 * Institute of Information Science, Academia Sinica(台湾中央研究院资讯科学研究所)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对多模态大语言模型空间感知局限,提出双BEATs架构,通过在编码前注入抖动噪声解决归一化问题,在三元方向分类任务中验证该方法有出色空间分辨率且能零样本泛化,证明标准模型经正则化可实现广义立体声音频理解。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07430 2026-07-09 cs.RO cs.SY eess.SY 新提交 50%

Immersive Social Interaction with VR and LLM-Assisted Humanoids

通过虚拟现实和大语言模型辅助的人形机器人实现沉浸式社交互动

Niraj Pudasaini, Geeta Chandra Raju Bethala, Pranav Doma, Anthony Tzes, Yi Fang

机构 * Inspire Robotics(Inspire机器人公司)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究通过集成语音控制移动、VR操作和双向社交互动的框架实现人形机器人全身控制,利用苹果视觉专业版等,经大语言模型辅助语音控制等技术,在宇树H1人形机器人上评估,新手操作成功率可观,证明该方式在多方面应用的潜力。

Comments IEEE-RAS International Conference on Humanoid Robots - Workshop: Designing Interactive Humanoids

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05808 2026-07-08 cs.CY 新提交 50%

Say What? Examining Text and Voice Input Modalities for Prompt-Based Programming in Computing Education

说什么?审视计算教育中基于提示的编程的文本和语音输入方式

Kaitlin Riegel, Yan Cathy Hua, Paul Denny, Victor-Alexandru Pădurean, Juho Leinonen, James Prather, Adish Singla

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 探索编程入门学生用文本或语音输入解决提示问题的情况,发现输入文本提示的学生更易首次尝试成功,多数学生偏好文本,定性分析揭示学生对两种输入方式的看法及优缺点,为计算教育多模态工具和教学设计提供启示。

Comments ITiCSE'26 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23243 2026-06-23 cs.LG cs.SD 新提交 50%

Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

从分散的医疗音频中解锁音频-语言模型的上下文学习

Ran Piao, Tsai-Ning Wang, Martijn den Dekker, Linda Moonen, Hareld Kemps, Yuan Lu, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学) Erasmus MC(伊拉斯姆斯医学中心) Rijnstate Hospital(莱茵州医院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出联邦自上下文学习(FSC)框架,通过无监督聚类构建伪标签片段,结合渐进式三阶段流水线,在联邦医院客户端实现少样本临床音频诊断,准确率达71.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21979 2026-06-23 cs.SD 新提交 50%

Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

面向开放集说话人属性预测的关键词附加大语言模型嵌入

Byoungjun So, Jaejun Lee, Kyogu Lee

机构 * Department of Intelligence and Information, Seoul National University(首尔大学情报信息学系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能跨学科项目) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出利用大语言模型嵌入进行开放集说话人属性预测,通过关键词附加策略和top-k负损失,在LibriTTS-P上超越闭集基准并泛化到未见同义词。

Comments This paper has been accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21933 2026-06-23 cs.SD 新提交 50%

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

ISCSLP 2026 CoT-TTS挑战赛:面向上下文感知文本转语音的思维链推理

Wei Xue, Junlan Feng, Shilei Zhang, Yue Wang, Ruosong Yang, Bei Liu, Liumeng Xue, Sitong Cheng, Jiahao Pan, Weizhen Bian, Boyi Kang, Bin Long

机构 * The Hong Kong University of Science and Technology(香港科技大学) China Mobile(中国移动) Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd., China Mobile(九天人工智能技术(北京)有限公司,中国移动) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Nanjing University(南京大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对现有可控TTS系统难以自动推断复杂对话场景中说话方式的问题,提出CoT-TTS挑战赛,要求系统从上下文推断说话方式并生成语音,包含文本和音频两个赛道,采用思维链推理和语音波形输出。

Comments 11 pages, ISCSLP 2026 challenge proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20418 2026-06-19 cs.SD 新提交 50%

MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

MixProLAP:混合诱导的不确定性建模用于概率性语言-音频预训练

Yu Nakagome, Jaesong Lee, Soo-Whan Chung

机构 * LINE WORKS Corporation(LINE WORKS公司) NAVER Cloud Corporation(NAVER Cloud公司)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出概率性音频-语言预训练框架MixProLAP,通过混合音频-文本对模拟重叠声音,建模多对多对应不确定性,并引入多级包含损失,在音频-文本检索中优于确定性基线。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19292 2026-06-18 cs.LG 新提交 50%

Risk Stratification for ICU Delirium using Pervasive Ambient Sensing Information

使用普适环境感知信息进行ICU谵妄风险分层

Jiaqing Zhang, Sabyasachi Bandyopadhyay, Miguel Contreras, Jessica Sena, Yuanfang Ren, Andrea Davidson, Ziyuan Guan, Tezcan Ozrazgat-Baslanti, Subhash Nerella, Azra Bihorac, Parisa Rashidi

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, United States(佛罗里达大学电气与计算机工程系) Department of Medicine, Stanford University, Stanford, United States(斯坦福大学医学系) Department of Biomedical Engineering, University of Florida, Gainesville, United States(佛罗里达大学生物医学工程系) Department of Medicine, University of Florida, Gainesville, United States(佛罗里达大学医学系)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究利用环境声音和光照强度数据,通过高效序列神经网络模型预测ICU患者谵妄风险,发现声音是主要预测因子,结合光照可改善短期预测,AUC达0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18924 2026-06-18 cs.SD 新提交 50%

Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs

谁赢得冲突?音频大模型中文本偏差的机制可解释性

Hyebin Cho, Suho Yoo, Jaehyuk Jang, Changick Kim, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文通过机制分析揭示音频大模型中的文本主导偏差,发现文本路径主动抑制完整音频表征,并提出无训练干预方法back-patching以增强音频表征,缓解文本主导。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17736 2026-06-17 q-bio.NC 新提交 50%

Ten Years of the Stochastic Resonance Model of Tinnitus: From Phantom Perception to Adaptive Sensory Optimization

耳鸣的随机共振模型十年:从幻想到自适应感觉优化

Patrick Krauss, Achim Schilling

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文综述了耳鸣的随机共振模型,该模型将耳鸣重新解释为听觉系统为补偿听力损失而自适应上调神经噪声的副产品,并总结了理论、实验和临床应用进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18228 2026-06-17 cs.HC 新提交 50%

MAJIC: Leveraging Articulatory Motion for Speech-based Emotion Recognition

MAJIC: 利用发音运动进行基于语音的情感识别

Tanmay Srivastava, Paras Bhavnani, Benjir Alvee Islam, Shubham Jain

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出MAJIC多模态情感识别系统,通过融合下颌和面部肌肉的发音运动特征与音频特征,在多种语言和场景下实现93%准确率和91%F1分数,优于纯音频基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15902 2026-06-16 cs.HC 新提交 50%

The Missing Layer: Why EdTech Needs Design-Time Generative UI, Not Just Runtime Personalization

缺失的层次:为什么教育科技需要设计时的生成式用户界面,而非仅运行时个性化

Seyed Parsa Neshaei, Abhinand Shibu, Fatma Betül Güres

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对教育科技中运行时生成式UI导致可访问性不足的问题,提出在创作层采用基于卡片的语义单元编码,由生成式AI在教学设计时生成多种界面表示,经教师验证后交付,实现公平可扩展的适应性教育。

Comments Accepted at the NextGen Learning Interfaces Workshop in AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11818 2026-06-11 cs.RO 新提交 50%

Human-Guided Co-Manipulation of Carbon Fiber Plies

碳纤维铺层的人机协同操作

Rami Ojanen, James Fant-Male, Roel Pieters

机构 * Automation Technology and Mechanical Engineering, Tampere University(坦佩雷大学自动化技术与机械工程系)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对柔性材料自动化处理困难的问题,本文提出结合语音指令、视觉腕部跟踪和力/柔顺控制的多模态方法,实现碳纤维铺层的高效人机协同操作。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09186 2026-06-09 cs.HC 新提交 50%

DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction

DuplexOmni:用于全双工交互的实时听、看、思考和说话

Muye Huang, Lingling Zhang, Xingyu Yu, Lei Shi, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jun Liu

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出DuplexOmni方法,通过异步协作的交互层(端到端实时处理流式音视频并生成响应)和思考层(复杂推理与工具使用)实现实时多模态全双工交互,并开发Writer-Director管道构建训练数据,在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏