arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2510.17633 2026-06-15 cs.SD cs.CR 版本更新 50%

SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering

SARSteer: 通过安全消融拒绝引导保护大型音频语言模型

Weilin Lin, Jianze Li, Hui Xiong, Li Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出SARSteer,首个针对大型音频语言模型的推理时防御框架,通过文本衍生的拒绝引导和分解安全空间消融,有效提升有害查询拒绝率并减少良性查询的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新 50%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15496 2026-06-15 cs.HC cs.RO 50%

Fast Multi-Party Open-Ended Conversation with a Social Robot

快速多方开放性对话与社交机器人

Giulio Antonio Abbo, Maria Jose Pinto-Bernal, Martijn Catrycke, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种结合多模态感知与大语言模型的多方对话系统,评估结果显示其在平行对话和小组讨论中表现出高参与度和准确率,但存在语音识别误差和响应延迟等技术限制。

Comments 15 pages, 5 figures, 4 tables; 2 appendices

Journal ref Front. Robot. AI 13:1766383 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11818 2026-06-11 cs.RO 新提交 50%

Human-Guided Co-Manipulation of Carbon Fiber Plies

碳纤维铺层的人机协同操作

Rami Ojanen, James Fant-Male, Roel Pieters

机构 * Automation Technology and Mechanical Engineering, Tampere University(坦佩雷大学自动化技术与机械工程系)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对柔性材料自动化处理困难的问题,本文提出结合语音指令、视觉腕部跟踪和力/柔顺控制的多模态方法,实现碳纤维铺层的高效人机协同操作。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06911 2026-06-11 cs.HC 50%

Physics-driven Sonification for Improving Multisensory Needle Guidance in Percutaneous Epicardial Access

物理驱动声化改善经皮心外膜入路中的多感官针引导

Veronica Ruozzi, Sasan Matinfar, Pasquale Vergara, Alessandro Albanesi, Serena Dell'Aversana, Stefano Carugo, Gianluigi Buccoliero, Nassir Navab, Alberto Redaelli, Emiliano Votta

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 针对透视下跳动心脏的经皮心外膜入路中针尖定位难题,提出基于物理驱动声化的扩展现实多感官导航方法,通过4D CTA动态心脏解剖重建与实时针追踪,结合多层物理膜模型听觉编码,显著提升导航安全性、准确性和降低认知负荷。

Comments This work has been submitted to the IEEE for possible publication

Journal ref in IEEE Access, vol. 14, pp. 80371-80385, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09186 2026-06-09 cs.HC 新提交 50%

DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction

DuplexOmni:用于全双工交互的实时听、看、思考和说话

Muye Huang, Lingling Zhang, Xingyu Yu, Lei Shi, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jun Liu

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出DuplexOmni方法,通过异步协作的交互层(端到端实时处理流式音视频并生成响应)和思考层(复杂推理与工具使用)实现实时多模态全双工交互,并开发Writer-Director管道构建训练数据,在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27838 2026-05-28 cs.SD 50%

Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

Dasheng AudioGen: 从文本生成连贯音频场景的统一模型

Jiahao Mei, Heinrich Dinkel, Yadong Niu, Xingwei Sun, Gang Li, Yifan Liao, Jiahao Zhou, Junbo Zhang, Jian Luan, Mengyue Wu

机构 * X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(上海交通大学XLANCE实验室,上海,中国) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司MiLM Plus,北京,中国)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出Dasheng AudioGen统一框架,通过结构化多视角描述和高维统一语义-声学表示,实现从文本到混合音频场景的端到端生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22521 2026-05-22 cs.RO cs.HC 50%

Quantifying Full-Body Immersion

量化全身沉浸

Alihan Bakir, Ekrem Yüksel, Fabio Zuliani, Neil Chennoufi, Francesco Bruno, Jamie Paik

机构 * Reconfigurable Robotics Lab(可重构机器人实验室)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出了一种基于全身动态交互的沉浸式虚拟体验新范式,通过音频视觉沉浸、物理沉浸和全身沉浸三个层次,结合模块化机器人表面单元实现可扩展的沉浸环境渲染,推动人与虚拟环境的共生。

Comments This manuscript is under consideration for possible publication in the Nature. Copyright may be transferred to Nature if the manuscript is accepted for publication, without further notice

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18168 2026-05-19 cs.CR cs.SD 50%

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

声学干扰:利用声学潜在语义进行通用劫持的新范式,针对大型音频语言模型

Yanyun Wang, Yu Huang, Zi Liang, Xixin Wu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出了一种新的声学干扰方法,通过利用声学潜在语义对大型音频语言模型进行通用劫持,揭示了安全对齐的脆弱性。

Comments 43rd International Conference on Machine Learning (ICML'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12002 2026-05-13 cs.LG 50%

Detecting In-Person Conversations in Noisy Real-World Environments with Smartwatch Audio and Motion Sensing

利用智能手表音频和运动传感检测嘈杂真实环境中的面对面对话

Alice Zhang, Callihan Bertley, Dawei Liang, Edison Thomaz

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种新型方法,通过智能手表融合音频和运动数据,检测面对面对话,实验表明融合惯性数据能显著提升检测性能,实验室和半自然环境下分别达到82.0%和77.2%的宏F1分数。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09656 2026-05-12 cs.RO 50%

ORICF -- Open Robotics Inference and Control Framework

ORICF -- 开源机器人推断与控制框架

Andrés Meseguer Valenzuela, Luís Miguel Bartolín Arnau

机构 * Instituto Tecnológico de Informática (ITI)(技术信息学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出ORICF框架,通过模块化设计实现多模态机器人推断流水线,支持边缘计算,降低计算开销和能耗,保持模块化和可重复性。

Comments Accepted in ICRA26 Workshop: 8th International Workshop on Robotics Software Engineering (RoSE 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09434 2026-05-12 cs.DC cs.HC cs.LG 50%

PoHAR: Understanding Hyperlocal Human Activities with Pollution Sensor Networks

PoHAR:利用污染传感器网络理解超本地人类活动

Prasenjit Karmakar, Karthik Reddy, Sandip Chakraborty

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Kharagpur(印度理工学院克拉格普尔)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出PoHAR框架,通过冲突自由的数据复制原语、分层聚类和基于领导者的分组推断,实现室内超本地活动检测,实验显示在设备上检测室内活动和烹饪活动的准确率分别达到97.41%和99.68%。

Comments 8 pages, 8 figures, accepted to IEEE DCOSS-IoT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20213 2026-05-12 cs.LG cs.CY 50%

Mixture of Experts for Recognizing Depression from Interview and Reading Tasks

专家混合模型用于从访谈和阅读任务中识别抑郁症

Loukas Ilias, Dimitris Askounis

机构 * DSS Laboratory, School of ECE, National Technical University of Athens, Greece(国家技术大学雅典分校电子工程系DSS实验室)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出利用多模态融合和专家混合模型,从访谈和阅读任务的语音中识别抑郁症,实现87%的准确率和86.66%的F1分数。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01153 2026-05-05 cs.HC 50%

Toward a Unified Framework for Collaborative Design of Human-AI Interaction

迈向人机交互协作设计的统一框架

Ankur Bhatt, Sven Mayer

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出统一框架整合多模态对齐、交互导向的可解释性及用户代理,通过协作设计与增强现实仓库机器人场景验证,提升人机交互透明度与用户控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00943 2026-05-05 cs.RO 50%

ARIS: Agentic and Relationship Intelligence System for Social Robots

ARIS:面向社交机器人的代理与关系智能系统

Stavya Datta, Fucai Ke, Leimin Tian, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ARIS通过整合多模态推理、图基社会世界模型和检索增强生成技术,提升社交机器人在多轮交互和社会关系推理中的能力,实验显示其在智能感知和用户亲和力方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24587 2026-05-01 stat.AP 50%

Bayesian inference for hidden Markov models under genuine multimodality with application to ecological time series

隐马尔可夫模型下的贝叶斯推断在真实多模态情况下的应用及生态时间序列分析

Marco A. Gallegos-Herrada, Vianey Leos-Barajas, Jeffrey S. Rosenthal

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了在隐马尔可夫模型中处理多模态似然函数的挑战,提出改进的平行温度算法以有效探索高维多模态后验分布,并通过蓝鲸潜水数据验证了该方法在生态时间序列分析中的应用。

Comments 37 pages, 11 figures, to be submitted to Bayesian Analysis, corrected author affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23077 2026-04-28 cs.IR 50%

Adopting State-of-the-Art Pretrained Audio Representations for Music Recommender Systems

采用最新预训练音频表示用于音乐推荐系统

Yan-Martin Tamm, Anna Aljanaki

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文评估了九种预训练模型在音乐推荐系统中的表现,发现其在传统MIR任务与冷热启动场景中性能差异显著,揭示了后端模型捕捉的音乐信息方面存在差异。

Comments Extended version of arXiv:2409.08987. Accepted for publication in the Special Issue "Highlights of RecSys '24" in ACM Transactions on Recommender Systems (TORS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 50%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10413 2026-04-14 cs.SD 50%

Sign-to-Speech Prosody Transfer via Sign Reconstruction-based GAN

通过手语重建的生成对抗网络实现手语到语音语调转换

Toranosuke Manabe, Yuto Shibata, Shinnosuke Takamichi, Yoshimitsu Aoki

机构 * Keio University(庆应义塾大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出手语到语音语调转换任务,通过SignRecGAN和S2PFormer模型,在无需跨模态标注的情况下实现手语语调信息的直接整合,提升语音合成的情感表达。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08518 2026-04-13 math.OC cs.LG 50%

SPP-SBL: Space-Power Prior Sparse Bayesian Learning for Block Sparse Recovery

SPP-SBL:空间功率先验稀疏贝叶斯学习用于块稀疏恢复

Yanhao Zhang, Zhihan Zhu, Yong Xia

机构 * LMIB of the Ministry of Education, School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院教育部数学、信息与行为重点实验室)

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文提出SPP-SBL方法,通过空间功率先验和EM算法结合高阶方程求解,解决块稀疏信号结构未知的恢复问题,提升恢复精度。

Comments IEEE Transactions on Signal Processing, 2026

Journal ref In IEEE Transactions on Signal Processing, vol. 74, pp. 1293-1308, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08363 2026-04-10 cs.SD 50%

CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation

CapTalk:单语句和对话语音生成的统一语音设计

Xiaosu Su, Zihan Sun, Peilei Jia, Jun Gao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Hello Group Inc.

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 CapTalk提出一种统一的文本-音频自回归框架,实现单语句和对话语音设计,通过分层变分条件模块平衡语音稳定性和上下文适应性,提升表达可控性和上下文恰当性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05683 2026-04-08 cs.SD 50%

Time-Domain Voice Identity Morphing (TD-VIM): A Signal-Level Approach to Morphing Attacks on Speaker Verification Systems

时域语音身份融合(TD-VIM):一种信号层面的语音验证系统攻击方法

Aravinda Reddy PN, Raghavendra Ramachandra, K. Sreenivasa Rao, Pabitra Mitra, Kunal Singh

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校) Norwegian University of Science and Technology (NTNU)(挪威科技大学)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出TD-VIM,一种在信号层面融合不同身份语音特征的方法,通过多语言音频-视觉智能手机数据库生成四个融合信号,并评估其在语音验证系统中的高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04093 2026-04-07 cs.HC 50%

BadgeX: IoT-Enhanced Wearable Analytics Meets LLMs for Collaborative Learning

BadgeX:物联网增强型可穿戴分析与大语言模型结合用于协作学习

Zaibei Li, Shunpei Yamaguchi, Qiuchi Li, Daniel Spikol

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 BadgeX结合轻量级可穿戴物联网设备与大语言模型,实现实时协作学习分析,通过多模态传感器数据生成高层面学习洞察。

Comments 4 pages, 2 figures. Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03998 2026-04-07 cs.RO 50%

VA-FastNavi-MARL: Real-Time Robot Control with Multimedia-Driven Meta-Reinforcement Learning

VA-FastNavi-MARL:基于多媒体驱动的元强化学习的实时机器人控制

Yang Zhang, Shengxi Jing, Fengxiang Wang, Yuan Feng, Hong Wang

机构 * School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Department of Mechanical and Aerospace Engineering, University of Missouri(密苏里大学机械与航空航天工程系) School of Construction Machinery, Chang’an University(长安大学工程机械学院) Key Laboratory of Intelligent Sensing System and Security (Ministry of Education), Hubei University(湖北大学智能感知系统与安全教育部重点实验室)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出VA-FastNavi-MARL框架,通过元强化学习将异步音频视觉输入统一为潜在表示,实现快速适应未知指令,提升实时控制性能。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

Journal ref 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03612 2026-04-07 cs.CR 50%

Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA

感知缺口:ASCII艺术与重叠音频作为CAPTCHA

Choon-Hou Rafael Chong

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了利用人类高度专业化神经处理的CAPTCHA任务,提出基于ASCII艺术和重叠音频的两种CAPTCHA类型,测试结果显示现有LLM无法有效解决,表明其在当前有效但可能面临AI发展挑战。

Comments 8 pages, 3 figures. Research paper proposing novel CAPTCHA methods using ASCII art and overlapping audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29820 2026-04-01 cs.SD 50%

SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision

SIREN:基于视觉的双耳音频重建

Mingyeong Song, Seoyeon Ko, Junhyug Noh

机构 * Ewha Womans University, Seoul, Korea(韩国首尔梨花女子大学)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 SIREN通过视觉引导将单声道音频转换为双耳音频,利用双头自注意力机制生成场景图,并通过两阶段波形域融合抑制混响,提升时间频率和相位敏感度指标。

Comments 5 pages, 1 figure, to appear in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28246 2026-03-31 cs.SE 50%

Voice-Controlled Scratch for Children with (Motor) Disabilities

为有(运动)障碍儿童的语音控制Scratch

Elias Goller, Gordon Fraser, Isabella Graßl

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文提出MeowCrophone,通过语音控制实现Scratch编程环境的无障碍编辑,采用多模态语音界面提升残障儿童的交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27562 2026-03-31 cs.HC 50%

VoxAnchor: Grounding Speech Authenticity in Throat Vibration via mmWave Radar

VoxAnchor:通过毫米波雷达接地语音真实性 via 喉部振动

Mingda Han, Huanqi Yang, Chaoqun Li, Wenhao Li, Guoming Zhang, Yanni Yang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出VoxAnchor系统,通过毫米波雷达捕捉喉部振动,结合语音声学与雷达信号,实现细粒度语音真实性验证,有效检测编辑、拼接等伪造手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27418 2026-03-31 cs.HC 50%

Buzz Buzz: Haptic Cuing of Road Conditions in Autonomous Cars for Drivers Engaged in Secondary Tasks

Buzz Buzz:自动驾驶车辆中通过触觉提示维持驾驶员情境意识的辅助驾驶功能

Shivam Pandey

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 研究通过触觉提示在自动驾驶中维持驾驶员情境意识,发现触觉信息能提升正确回答率并减少看屏幕次数,且不影响次要任务表现。

Comments Ph.D. dissertation at Rice University. April 2021. Main text and appendices are 75 pages, 35 figures combined

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23415 2026-03-25 cs.CY 50%

Integrating GenAI in Filmmaking: From Co-Creativity to Distributed Creativity

将生成式AI融入影视创作:从协同创作到分布式创作

Pierluigi Masai, Lorenzo Carta, Mateusz Miroslaw Lis

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文从社会技术史视角探讨生成式AI在影视创作中的作用,提出影视创作是分布式过程,技术革新重塑了传统创作流程与美学。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏