arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2606.20418 2026-06-19 cs.SD 新提交 50%

MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

MixProLAP:混合诱导的不确定性建模用于概率性语言-音频预训练

Yu Nakagome, Jaesong Lee, Soo-Whan Chung

机构 * LINE WORKS Corporation(LINE WORKS公司) NAVER Cloud Corporation(NAVER Cloud公司)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出概率性音频-语言预训练框架MixProLAP,通过混合音频-文本对模拟重叠声音,建模多对多对应不确定性,并引入多级包含损失,在音频-文本检索中优于确定性基线。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19292 2026-06-18 cs.LG 新提交 50%

Risk Stratification for ICU Delirium using Pervasive Ambient Sensing Information

使用普适环境感知信息进行ICU谵妄风险分层

Jiaqing Zhang, Sabyasachi Bandyopadhyay, Miguel Contreras, Jessica Sena, Yuanfang Ren, Andrea Davidson, Ziyuan Guan, Tezcan Ozrazgat-Baslanti, Subhash Nerella, Azra Bihorac, Parisa Rashidi

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, United States(佛罗里达大学电气与计算机工程系) Department of Medicine, Stanford University, Stanford, United States(斯坦福大学医学系) Department of Biomedical Engineering, University of Florida, Gainesville, United States(佛罗里达大学生物医学工程系) Department of Medicine, University of Florida, Gainesville, United States(佛罗里达大学医学系)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究利用环境声音和光照强度数据,通过高效序列神经网络模型预测ICU患者谵妄风险,发现声音是主要预测因子,结合光照可改善短期预测,AUC达0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18924 2026-06-18 cs.SD 新提交 50%

Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs

谁赢得冲突?音频大模型中文本偏差的机制可解释性

Hyebin Cho, Suho Yoo, Jaehyuk Jang, Changick Kim, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文通过机制分析揭示音频大模型中的文本主导偏差,发现文本路径主动抑制完整音频表征,并提出无训练干预方法back-patching以增强音频表征,缓解文本主导。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17736 2026-06-17 q-bio.NC 新提交 50%

Ten Years of the Stochastic Resonance Model of Tinnitus: From Phantom Perception to Adaptive Sensory Optimization

耳鸣的随机共振模型十年:从幻想到自适应感觉优化

Patrick Krauss, Achim Schilling

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文综述了耳鸣的随机共振模型,该模型将耳鸣重新解释为听觉系统为补偿听力损失而自适应上调神经噪声的副产品,并总结了理论、实验和临床应用进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18228 2026-06-17 cs.HC 新提交 50%

MAJIC: Leveraging Articulatory Motion for Speech-based Emotion Recognition

MAJIC: 利用发音运动进行基于语音的情感识别

Tanmay Srivastava, Paras Bhavnani, Benjir Alvee Islam, Shubham Jain

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出MAJIC多模态情感识别系统,通过融合下颌和面部肌肉的发音运动特征与音频特征,在多种语言和场景下实现93%准确率和91%F1分数,优于纯音频基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15902 2026-06-16 cs.HC 新提交 50%

The Missing Layer: Why EdTech Needs Design-Time Generative UI, Not Just Runtime Personalization

缺失的层次:为什么教育科技需要设计时的生成式用户界面,而非仅运行时个性化

Seyed Parsa Neshaei, Abhinand Shibu, Fatma Betül Güres

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对教育科技中运行时生成式UI导致可访问性不足的问题,提出在创作层采用基于卡片的语义单元编码,由生成式AI在教学设计时生成多种界面表示,经教师验证后交付,实现公平可扩展的适应性教育。

Comments Accepted at the NextGen Learning Interfaces Workshop in AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07676 2026-06-16 cs.NE eess.SP 版本更新 50%

A Primer on Evolutionary Optimization Frameworks for Near-Field Multi-Source Localization

近场多源定位的进化优化框架入门

Seyed Jalaleddin Mousavirad, Parisa Ramezani, Mattias O'Nils, Emil Björnson

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出两种基于进化优化的无网格、无训练连续域搜索框架,用于近场多源定位,克服了MUSIC等网格子空间方法和深度学习的局限,通过差分进化实现高精度定位。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17633 2026-06-15 cs.SD cs.CR 版本更新 50%

SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering

SARSteer: 通过安全消融拒绝引导保护大型音频语言模型

Weilin Lin, Jianze Li, Hui Xiong, Li Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出SARSteer,首个针对大型音频语言模型的推理时防御框架,通过文本衍生的拒绝引导和分解安全空间消融,有效提升有害查询拒绝率并减少良性查询的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新 50%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15496 2026-06-15 cs.HC cs.RO 50%

Fast Multi-Party Open-Ended Conversation with a Social Robot

快速多方开放性对话与社交机器人

Giulio Antonio Abbo, Maria Jose Pinto-Bernal, Martijn Catrycke, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种结合多模态感知与大语言模型的多方对话系统,评估结果显示其在平行对话和小组讨论中表现出高参与度和准确率,但存在语音识别误差和响应延迟等技术限制。

Comments 15 pages, 5 figures, 4 tables; 2 appendices

Journal ref Front. Robot. AI 13:1766383 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11818 2026-06-11 cs.RO 新提交 50%

Human-Guided Co-Manipulation of Carbon Fiber Plies

碳纤维铺层的人机协同操作

Rami Ojanen, James Fant-Male, Roel Pieters

机构 * Automation Technology and Mechanical Engineering, Tampere University(坦佩雷大学自动化技术与机械工程系)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对柔性材料自动化处理困难的问题,本文提出结合语音指令、视觉腕部跟踪和力/柔顺控制的多模态方法,实现碳纤维铺层的高效人机协同操作。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06911 2026-06-11 cs.HC 50%

Physics-driven Sonification for Improving Multisensory Needle Guidance in Percutaneous Epicardial Access

物理驱动声化改善经皮心外膜入路中的多感官针引导

Veronica Ruozzi, Sasan Matinfar, Pasquale Vergara, Alessandro Albanesi, Serena Dell'Aversana, Stefano Carugo, Gianluigi Buccoliero, Nassir Navab, Alberto Redaelli, Emiliano Votta

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 针对透视下跳动心脏的经皮心外膜入路中针尖定位难题,提出基于物理驱动声化的扩展现实多感官导航方法,通过4D CTA动态心脏解剖重建与实时针追踪,结合多层物理膜模型听觉编码,显著提升导航安全性、准确性和降低认知负荷。

Comments This work has been submitted to the IEEE for possible publication

Journal ref in IEEE Access, vol. 14, pp. 80371-80385, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09186 2026-06-09 cs.HC 新提交 50%

DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction

DuplexOmni:用于全双工交互的实时听、看、思考和说话

Muye Huang, Lingling Zhang, Xingyu Yu, Lei Shi, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jun Liu

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出DuplexOmni方法,通过异步协作的交互层(端到端实时处理流式音视频并生成响应)和思考层(复杂推理与工具使用)实现实时多模态全双工交互,并开发Writer-Director管道构建训练数据,在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27838 2026-05-28 cs.SD 50%

Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

Dasheng AudioGen: 从文本生成连贯音频场景的统一模型

Jiahao Mei, Heinrich Dinkel, Yadong Niu, Xingwei Sun, Gang Li, Yifan Liao, Jiahao Zhou, Junbo Zhang, Jian Luan, Mengyue Wu

机构 * X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(上海交通大学XLANCE实验室,上海,中国) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司MiLM Plus,北京,中国)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出Dasheng AudioGen统一框架,通过结构化多视角描述和高维统一语义-声学表示,实现从文本到混合音频场景的端到端生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22521 2026-05-22 cs.RO cs.HC 50%

Quantifying Full-Body Immersion

量化全身沉浸

Alihan Bakir, Ekrem Yüksel, Fabio Zuliani, Neil Chennoufi, Francesco Bruno, Jamie Paik

机构 * Reconfigurable Robotics Lab(可重构机器人实验室)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出了一种基于全身动态交互的沉浸式虚拟体验新范式,通过音频视觉沉浸、物理沉浸和全身沉浸三个层次,结合模块化机器人表面单元实现可扩展的沉浸环境渲染,推动人与虚拟环境的共生。

Comments This manuscript is under consideration for possible publication in the Nature. Copyright may be transferred to Nature if the manuscript is accepted for publication, without further notice

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18168 2026-05-19 cs.CR cs.SD 50%

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

声学干扰:利用声学潜在语义进行通用劫持的新范式,针对大型音频语言模型

Yanyun Wang, Yu Huang, Zi Liang, Xixin Wu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出了一种新的声学干扰方法,通过利用声学潜在语义对大型音频语言模型进行通用劫持,揭示了安全对齐的脆弱性。

Comments 43rd International Conference on Machine Learning (ICML'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12002 2026-05-13 cs.LG 50%

Detecting In-Person Conversations in Noisy Real-World Environments with Smartwatch Audio and Motion Sensing

利用智能手表音频和运动传感检测嘈杂真实环境中的面对面对话

Alice Zhang, Callihan Bertley, Dawei Liang, Edison Thomaz

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种新型方法,通过智能手表融合音频和运动数据,检测面对面对话,实验表明融合惯性数据能显著提升检测性能,实验室和半自然环境下分别达到82.0%和77.2%的宏F1分数。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09656 2026-05-12 cs.RO 50%

ORICF -- Open Robotics Inference and Control Framework

ORICF -- 开源机器人推断与控制框架

Andrés Meseguer Valenzuela, Luís Miguel Bartolín Arnau

机构 * Instituto Tecnológico de Informática (ITI)(技术信息学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出ORICF框架,通过模块化设计实现多模态机器人推断流水线,支持边缘计算,降低计算开销和能耗,保持模块化和可重复性。

Comments Accepted in ICRA26 Workshop: 8th International Workshop on Robotics Software Engineering (RoSE 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09434 2026-05-12 cs.DC cs.HC cs.LG 50%

PoHAR: Understanding Hyperlocal Human Activities with Pollution Sensor Networks

PoHAR:利用污染传感器网络理解超本地人类活动

Prasenjit Karmakar, Karthik Reddy, Sandip Chakraborty

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Kharagpur(印度理工学院克拉格普尔)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出PoHAR框架,通过冲突自由的数据复制原语、分层聚类和基于领导者的分组推断,实现室内超本地活动检测,实验显示在设备上检测室内活动和烹饪活动的准确率分别达到97.41%和99.68%。

Comments 8 pages, 8 figures, accepted to IEEE DCOSS-IoT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20213 2026-05-12 cs.LG cs.CY 50%

Mixture of Experts for Recognizing Depression from Interview and Reading Tasks

专家混合模型用于从访谈和阅读任务中识别抑郁症

Loukas Ilias, Dimitris Askounis

机构 * DSS Laboratory, School of ECE, National Technical University of Athens, Greece(国家技术大学雅典分校电子工程系DSS实验室)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出利用多模态融合和专家混合模型,从访谈和阅读任务的语音中识别抑郁症,实现87%的准确率和86.66%的F1分数。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01153 2026-05-05 cs.HC 50%

Toward a Unified Framework for Collaborative Design of Human-AI Interaction

迈向人机交互协作设计的统一框架

Ankur Bhatt, Sven Mayer

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出统一框架整合多模态对齐、交互导向的可解释性及用户代理,通过协作设计与增强现实仓库机器人场景验证,提升人机交互透明度与用户控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00943 2026-05-05 cs.RO 50%

ARIS: Agentic and Relationship Intelligence System for Social Robots

ARIS:面向社交机器人的代理与关系智能系统

Stavya Datta, Fucai Ke, Leimin Tian, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ARIS通过整合多模态推理、图基社会世界模型和检索增强生成技术,提升社交机器人在多轮交互和社会关系推理中的能力,实验显示其在智能感知和用户亲和力方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24587 2026-05-01 stat.AP 50%

Bayesian inference for hidden Markov models under genuine multimodality with application to ecological time series

隐马尔可夫模型下的贝叶斯推断在真实多模态情况下的应用及生态时间序列分析

Marco A. Gallegos-Herrada, Vianey Leos-Barajas, Jeffrey S. Rosenthal

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了在隐马尔可夫模型中处理多模态似然函数的挑战,提出改进的平行温度算法以有效探索高维多模态后验分布,并通过蓝鲸潜水数据验证了该方法在生态时间序列分析中的应用。

Comments 37 pages, 11 figures, to be submitted to Bayesian Analysis, corrected author affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23077 2026-04-28 cs.IR 50%

Adopting State-of-the-Art Pretrained Audio Representations for Music Recommender Systems

采用最新预训练音频表示用于音乐推荐系统

Yan-Martin Tamm, Anna Aljanaki

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文评估了九种预训练模型在音乐推荐系统中的表现,发现其在传统MIR任务与冷热启动场景中性能差异显著,揭示了后端模型捕捉的音乐信息方面存在差异。

Comments Extended version of arXiv:2409.08987. Accepted for publication in the Special Issue "Highlights of RecSys '24" in ACM Transactions on Recommender Systems (TORS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 50%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10413 2026-04-14 cs.SD 50%

Sign-to-Speech Prosody Transfer via Sign Reconstruction-based GAN

通过手语重建的生成对抗网络实现手语到语音语调转换

Toranosuke Manabe, Yuto Shibata, Shinnosuke Takamichi, Yoshimitsu Aoki

机构 * Keio University(庆应义塾大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出手语到语音语调转换任务,通过SignRecGAN和S2PFormer模型,在无需跨模态标注的情况下实现手语语调信息的直接整合,提升语音合成的情感表达。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08518 2026-04-13 math.OC cs.LG 50%

SPP-SBL: Space-Power Prior Sparse Bayesian Learning for Block Sparse Recovery

SPP-SBL:空间功率先验稀疏贝叶斯学习用于块稀疏恢复

Yanhao Zhang, Zhihan Zhu, Yong Xia

机构 * LMIB of the Ministry of Education, School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院教育部数学、信息与行为重点实验室)

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文提出SPP-SBL方法,通过空间功率先验和EM算法结合高阶方程求解,解决块稀疏信号结构未知的恢复问题,提升恢复精度。

Comments IEEE Transactions on Signal Processing, 2026

Journal ref In IEEE Transactions on Signal Processing, vol. 74, pp. 1293-1308, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08363 2026-04-10 cs.SD 50%

CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation

CapTalk:单语句和对话语音生成的统一语音设计

Xiaosu Su, Zihan Sun, Peilei Jia, Jun Gao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Hello Group Inc.

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 CapTalk提出一种统一的文本-音频自回归框架,实现单语句和对话语音设计,通过分层变分条件模块平衡语音稳定性和上下文适应性,提升表达可控性和上下文恰当性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05683 2026-04-08 cs.SD 50%

Time-Domain Voice Identity Morphing (TD-VIM): A Signal-Level Approach to Morphing Attacks on Speaker Verification Systems

时域语音身份融合(TD-VIM):一种信号层面的语音验证系统攻击方法

Aravinda Reddy PN, Raghavendra Ramachandra, K. Sreenivasa Rao, Pabitra Mitra, Kunal Singh

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校) Norwegian University of Science and Technology (NTNU)(挪威科技大学)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出TD-VIM,一种在信号层面融合不同身份语音特征的方法,通过多语言音频-视觉智能手机数据库生成四个融合信号,并评估其在语音验证系统中的高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04093 2026-04-07 cs.HC 50%

BadgeX: IoT-Enhanced Wearable Analytics Meets LLMs for Collaborative Learning

BadgeX:物联网增强型可穿戴分析与大语言模型结合用于协作学习

Zaibei Li, Shunpei Yamaguchi, Qiuchi Li, Daniel Spikol

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 BadgeX结合轻量级可穿戴物联网设备与大语言模型,实现实时协作学习分析,通过多模态传感器数据生成高层面学习洞察。

Comments 4 pages, 2 figures. Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏