arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2604.03998 2026-04-07 cs.RO 50%

VA-FastNavi-MARL: Real-Time Robot Control with Multimedia-Driven Meta-Reinforcement Learning

VA-FastNavi-MARL:基于多媒体驱动的元强化学习的实时机器人控制

Yang Zhang, Shengxi Jing, Fengxiang Wang, Yuan Feng, Hong Wang

机构 * School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Department of Mechanical and Aerospace Engineering, University of Missouri(密苏里大学机械与航空航天工程系) School of Construction Machinery, Chang’an University(长安大学工程机械学院) Key Laboratory of Intelligent Sensing System and Security (Ministry of Education), Hubei University(湖北大学智能感知系统与安全教育部重点实验室)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出VA-FastNavi-MARL框架,通过元强化学习将异步音频视觉输入统一为潜在表示,实现快速适应未知指令,提升实时控制性能。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

Journal ref 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03612 2026-04-07 cs.CR 50%

Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA

感知缺口:ASCII艺术与重叠音频作为CAPTCHA

Choon-Hou Rafael Chong

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了利用人类高度专业化神经处理的CAPTCHA任务,提出基于ASCII艺术和重叠音频的两种CAPTCHA类型,测试结果显示现有LLM无法有效解决,表明其在当前有效但可能面临AI发展挑战。

Comments 8 pages, 3 figures. Research paper proposing novel CAPTCHA methods using ASCII art and overlapping audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29820 2026-04-01 cs.SD 50%

SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision

SIREN:基于视觉的双耳音频重建

Mingyeong Song, Seoyeon Ko, Junhyug Noh

机构 * Ewha Womans University, Seoul, Korea(韩国首尔梨花女子大学)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 SIREN通过视觉引导将单声道音频转换为双耳音频,利用双头自注意力机制生成场景图,并通过两阶段波形域融合抑制混响,提升时间频率和相位敏感度指标。

Comments 5 pages, 1 figure, to appear in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28246 2026-03-31 cs.SE 50%

Voice-Controlled Scratch for Children with (Motor) Disabilities

为有(运动)障碍儿童的语音控制Scratch

Elias Goller, Gordon Fraser, Isabella Graßl

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文提出MeowCrophone,通过语音控制实现Scratch编程环境的无障碍编辑,采用多模态语音界面提升残障儿童的交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27562 2026-03-31 cs.HC 50%

VoxAnchor: Grounding Speech Authenticity in Throat Vibration via mmWave Radar

VoxAnchor:通过毫米波雷达接地语音真实性 via 喉部振动

Mingda Han, Huanqi Yang, Chaoqun Li, Wenhao Li, Guoming Zhang, Yanni Yang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出VoxAnchor系统,通过毫米波雷达捕捉喉部振动,结合语音声学与雷达信号,实现细粒度语音真实性验证,有效检测编辑、拼接等伪造手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27418 2026-03-31 cs.HC 50%

Buzz Buzz: Haptic Cuing of Road Conditions in Autonomous Cars for Drivers Engaged in Secondary Tasks

Buzz Buzz:自动驾驶车辆中通过触觉提示维持驾驶员情境意识的辅助驾驶功能

Shivam Pandey

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 研究通过触觉提示在自动驾驶中维持驾驶员情境意识,发现触觉信息能提升正确回答率并减少看屏幕次数,且不影响次要任务表现。

Comments Ph.D. dissertation at Rice University. April 2021. Main text and appendices are 75 pages, 35 figures combined

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23415 2026-03-25 cs.CY 50%

Integrating GenAI in Filmmaking: From Co-Creativity to Distributed Creativity

将生成式AI融入影视创作:从协同创作到分布式创作

Pierluigi Masai, Lorenzo Carta, Mateusz Miroslaw Lis

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文从社会技术史视角探讨生成式AI在影视创作中的作用,提出影视创作是分布式过程,技术革新重塑了传统创作流程与美学。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07010 2026-03-24 cs.LG 50%

Always Keep Your Promises: A Model-Agnostic Attribution Algorithm for Neural Networks

始终信守承诺:一种针对神经网络的模型无关属性算法

Kevin Lee, Duncan Smith-Halverson, Pablo Millan Arias

机构 * David R. Cheriton School of Computer Science, University of Waterloo, ON, Canada(滑铁卢大学戴维·R·切里顿计算机科学学院) Scotiabank AML AI Research, Toronto, ON, Canada(多伦多加拿大Scotiabank反洗钱AI研究)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出DynamicLRP,一种在张量操作层面运行的模型无关LRP框架,通过分解计算图中的属性并引入新的延迟激活解决机制,实现了真正的架构无关性,同时保持了LRP的理论保证,并在多个模型上展示了高准确性与效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 50%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13313 2026-03-17 cs.RO 50%

MRPoS: Mixed Reality-Based Robot Navigation Interface Using Spatial Pointing and Speech with Large Language Model

基于混合现实的机器人导航接口:结合空间指针与语音及大语言模型

Eduardo Iglesius, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出MRPoS接口,利用空间指针和语音交互替代传统手势,提升机器人导航的直观性和效率,实验表明任务完成时间与工作负荷显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11303 2026-03-13 cs.HC 50%

Bridging the Cognitive Gap: Co-Designing and Evaluating a Voice-Enabled Community Chatbot for Older Adults

弥合认知鸿沟:为老年人设计和评估一个语音启用的社区聊天机器人

Feng Chen, Luna Xingyu Li, Ray-Yuan Chung, Wenyu Zeng, Yein Jeon, Yizhou Hu, Oleg Zaslavsky

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种语音启用的社区聊天机器人,通过共设计和教育工作坊,提升老年人对AI的认知和透明度,同时探索零触控导航对年龄包容性AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10862 2026-03-12 cs.SD 50%

OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs

OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型

Yujie Liao, Xuelong Geng, Hongfei Xue, Shuiyuan Wang, Lei Xie

机构 * Ascend NPUs(Ascend NPU)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08571 2026-03-10 cs.HC cs.IR cs.SD 50%

LoopLens: Supporting Search as Creation in Loop-Based Music Composition

LoopLens:在基于循环的音乐创作中支持搜索作为创作

Sheng Long, Atsuya Kobayashi, Kei Tateno

机构 * Northwestern University(西北大学) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 LoopLens通过可视化音频搜索结果,支持在基于循环的音乐创作中进行创意搜索与拼接,揭示了不同专业背景用户在探索与利用之间的行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05793 2026-03-09 cs.HC 50%

A Closed-Loop CPR Training Glove with Integrated Tactile Sensing and Haptic Feedback

闭环式带集成触觉感知与触觉反馈的CPR训练手套

Jaeyoung Moon, Mingzhuo Ma, Qifeng Yang, Youjin Choi, Seokhyun Hwang, Samuel Burden, Kyung-Joong Kim, Yiyue Luo

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出了一种闭环CPR训练手套,通过集成触觉感知和触觉反馈,提升自主练习中的CPR质量与准确性。

Comments 8pages, 10 figures, This paper is accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00789 2026-03-09 physics.app-ph physics.flu-dyn 50%

Aeroacoustic signatures reveal fast transient dynamics of vapor-jet-driven cavity oscillations in metallic additive manufacturing

气动声学特征揭示金属增材制造中蒸发喷射驱动腔体振荡的快速瞬态动力学

Haolin Liu, S. Kiana Naghibzadeh, Zhongshu Ren, Yanming Zhang, Jiayun Shao, Samuel J. Clark, Kamel Fezzaa, Xuzhe Zeng, Lin Gao, Wentao Yan, Noel Walkington, Kaushik Dayal, Tao Sun, Anthony D. Rollett, Levent Burak Kara

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 该研究通过气动声学特征揭示金属增材制造中蒸发喷射驱动的腔体振荡快速瞬态动力学,利用声学信号耦合瞬时腔体深度和振荡频率,重新定义蒸发过程的临界频率事件。

Comments 35 pages 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07619 2026-03-09 cs.RO 50%

CAVER: Curious Audiovisual Exploring Robot

CAVER:好奇的视听探索机器人

Luca Macesanu, Boueny Folefack, Samik Singh, Ruchira Ray, Ben Abbatematteo, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 CAVER是一种新型机器人,通过好奇心驱动的探索算法和多模态视听表示,提升材料分类和音频示范模仿的性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14063 2026-03-09 cs.RO 50%

Language Conditioning Improves Accuracy of Aircraft Goal Prediction in Non-Towered Airspace

语言引导提升非塔台空域飞机目标预测的准确性

Sundhar Vinodh Sangeetha, Chih-Yuan Chiu, Sarah H. Q. Li, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院) School of Aerospace Engineering(航空航天工程学院) School of Electrical and Computer Engineering(电气与计算机工程学院) School of Mechanical Engineering(机械工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出利用语言信息提升非塔台空域飞机目标预测准确性的多模态框架,通过整合自然语言理解和空间推理,有效提高自主决策能力。

Comments The last two authors advised equally. Accepted to the 2026 IEEE International Conference on Robotics and Automation. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12386 2026-03-04 cs.HC 50%

Hey Dashboard!: Supporting Voice, Text, and Pointing Modalities in Dashboard Onboarding

Hey Dashboard!:在仪表盘引导中支持语音、文本和指向模态

Vaishali Dhanoa, Gabriela Molina León, Eve Hoggan, Eduard Gröller, Marc Streit, Niklas Elmqvist

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 DIANA通过语音、文本和指向等多种模态,为仪表盘引导提供自助导航和分析支持,提升用户在复杂仪表盘中的使用效率。

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22131 2026-02-26 cs.HC 50%

Giving Meaning to Movements: Challenges and Opportunities in Expanding Communication by Pairing Unaided AAC with Speech Generated Messages

为动作赋予意义:通过将无辅助AAC与语音生成信息结合扩展沟通的挑战与机遇

Imran Kabir, Sharon Ann Redmon, Lynn R Elko, Kevin Williams, Mitchell A Case, Dawn J Sowers, Krista Wilkinson, Syed Masum Billah

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出AllyAAC系统,通过结合无辅助AAC与语音生成信息,解决个性化肢体动作识别挑战,提升沟通效率与可理解性。

Comments To appear in Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD 50%

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12918 2026-02-16 cs.RO 50%

Adding internal audio sensing to internal vision enables human-like in-hand fabric recognition with soft robotic fingertips

添加内部音频感知至内部视觉可使软机器人指尖实现类人手持织物识别

Iris Andrussow, Jans Solano, Benjamin A. Richardson, Georg Martius, Katherine J. Kuchenbecker

机构 * Haptic Intelligence Department, Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所人机交互部门) Department for Distributed Intelligence / Autonomous Learning, University of Tübingen(图宾根大学分布式智能/自主学习部门)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本研究通过结合内部视觉和音频感知,使软机器人指尖实现类人织物识别,利用变压器方法在 20 种常见织物上达到 97% 分类准确率。

Journal ref 2025 IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13148 2026-02-16 cs.SD 50%

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

大音频语言模型能理解音频吗?LALMs的语音、场景和事件理解基准

Han Yin, Jung-Woo Choi

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学电气工程学院)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出SSEU-Bench,首个考虑语音与非语音音频能量差异的音频理解基准,通过链式思维提升LALMs在联合理解任务中的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11906 2026-02-16 cs.RO 50%

Palpation Alters Auditory Pain Expressions with Gender-Specific Variations in Robopatients

触诊改变与性别相关的听觉疼痛表达在仿生患者中

Chapa Sirithunge, Yue Xie, Saitarun Nadipineni, Fumiya Iida, Thilina Dulantha Lalitharatne

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) School of Engineering and Materials Science in Queen Mary University of London(伦敦大学玛丽女王学院工程与材料科学学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种基于人类在环强化学习的仿生患者听觉疼痛表达生成方法,通过动态调整触诊力与声音反馈的关系,实现性别差异的个性化疼痛表达,以提升医疗模拟训练效果。

Comments 12 pages, 9 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12416 2026-02-16 cs.RO cs.SY eess.SY 50%

Control Barrier Functions with Audio Risk Awareness for Robot Safe Navigation on Construction Sites

具有音频风险意识的控制障碍函数用于建筑工地机器人安全导航

Johannes Mootz, Reza Akhavian

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种基于控制障碍函数的机器人安全导航方法,通过音频风险提示增强避障能力,有效提升建设工地环境下的自主导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08930 2026-02-13 cs.SD 50%

No Word Left Behind: Mitigating Prefix Bias in Open-Vocabulary Keyword Spotting

无词遗留:减轻开放式词汇关键词定位中的前缀偏差

Yi Liu, Chuan-Che Huang, Xiao Quan

机构 * University of California San Diego, Dept. of Electrical and Computer Engineering(加州大学圣迭戈分校电子与计算机工程系) Bose Corporation(博世公司)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出EPS方法,通过减轻开放式词汇关键词定位中的前缀偏差,显著提升识别准确率,同时保持其他数据集的性能。

Comments Published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07266 2026-02-10 cs.HC 50%

ADCanvas: Accessible and Conversational Audio Description Authoring for Blind and Low Vision Creators

ADCanvas: 为视障和低视力创作者提供可访问且对话式的音频描述创作工具

Franklin Mingzhe Li, Michael Xieyang Liu, Cynthia L. Bennett, Shaun K. Kane

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ADCanvas为视障和低视力创作者提供可访问且对话式的音频描述创作工具,通过多模态交互支持端到端的AD创作和视觉问答。

Comments 21 pages, 4 figures, published in CHI '26

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02602 2026-02-04 cs.CR cs.LG 50%

Position: 3D Gaussian Splatting Watermarking Should Be Scenario-Driven and Threat-Model Explicit

位置:3D高斯散射水印应基于场景驱动和威胁模型明确

Yangfan Deng, Anirudh Nakra, Min Wu

机构 * University of Maryland, College Park, MD, United States(马里兰大学学院公园分校)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文主张3D资产水印技术应基于场景驱动和威胁模型明确,以提升知识产权保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01559 2026-01-30 cs.SD 50%

LLM2Fx-Tools: Tool Calling For Music Post-Production

LLM2Fx-Tools: 音乐后期制作中的工具调用

Seungheon Doh, Junghyun Koo, Marco A. Martínez-Ramírez, Woosung Choi, Wei-Hsiang Liao, Qiyu Wu, Juhan Nam, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 LLM2Fx-Tools通过LLM实现音频效果模块的工具调用,生成可执行的音频效果序列,提升音乐后期制作的可解释性和可控性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19281 2026-01-28 cs.HC 50%

Gazeify Then Voiceify: Physical Object Referencing Through Gaze and Voice Interaction with Displayless Smart Glasses

通过眼动和语音交互实现无显示屏智能眼镜的物理物体指认

Zheng Zhang, Mengjie Yu, Tianyi Wang, Kashyap Todi, Ajoy Savio Fernandes, Yue Liu, Haijun Xia, Tovi Grossman, Tanya Jonker

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 无显示屏智能眼镜通过眼动和语音交互实现物理物体指认,结合先进分割与视觉-语言模型,提升交互准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17287 2026-01-27 cs.RO 50%

Real-Time Synchronized Interaction Framework for Emotion-Aware Humanoid Robots

面向情感感知人形机器人的实时同步交互框架

Yanrong Chen, Xihan Bian

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种实时框架,通过双通道情感引擎、动态时间规整和闭环验证,实现人形机器人的情感同步交互,提升在医疗、教育等动态场景中的应用能力。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏