arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2512.07010 2026-03-24 cs.LG 50%

Always Keep Your Promises: A Model-Agnostic Attribution Algorithm for Neural Networks

始终信守承诺:一种针对神经网络的模型无关属性算法

Kevin Lee, Duncan Smith-Halverson, Pablo Millan Arias

机构 * David R. Cheriton School of Computer Science, University of Waterloo, ON, Canada(滑铁卢大学戴维·R·切里顿计算机科学学院) Scotiabank AML AI Research, Toronto, ON, Canada(多伦多加拿大Scotiabank反洗钱AI研究)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出DynamicLRP,一种在张量操作层面运行的模型无关LRP框架,通过分解计算图中的属性并引入新的延迟激活解决机制,实现了真正的架构无关性,同时保持了LRP的理论保证,并在多个模型上展示了高准确性与效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 50%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13313 2026-03-17 cs.RO 50%

MRPoS: Mixed Reality-Based Robot Navigation Interface Using Spatial Pointing and Speech with Large Language Model

基于混合现实的机器人导航接口:结合空间指针与语音及大语言模型

Eduardo Iglesius, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出MRPoS接口,利用空间指针和语音交互替代传统手势,提升机器人导航的直观性和效率,实验表明任务完成时间与工作负荷显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11303 2026-03-13 cs.HC 50%

Bridging the Cognitive Gap: Co-Designing and Evaluating a Voice-Enabled Community Chatbot for Older Adults

弥合认知鸿沟:为老年人设计和评估一个语音启用的社区聊天机器人

Feng Chen, Luna Xingyu Li, Ray-Yuan Chung, Wenyu Zeng, Yein Jeon, Yizhou Hu, Oleg Zaslavsky

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种语音启用的社区聊天机器人,通过共设计和教育工作坊,提升老年人对AI的认知和透明度,同时探索零触控导航对年龄包容性AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10862 2026-03-12 cs.SD 50%

OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs

OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型

Yujie Liao, Xuelong Geng, Hongfei Xue, Shuiyuan Wang, Lei Xie

机构 * Ascend NPUs(Ascend NPU)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08571 2026-03-10 cs.HC cs.IR cs.SD 50%

LoopLens: Supporting Search as Creation in Loop-Based Music Composition

LoopLens:在基于循环的音乐创作中支持搜索作为创作

Sheng Long, Atsuya Kobayashi, Kei Tateno

机构 * Northwestern University(西北大学) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 LoopLens通过可视化音频搜索结果,支持在基于循环的音乐创作中进行创意搜索与拼接,揭示了不同专业背景用户在探索与利用之间的行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05793 2026-03-09 cs.HC 50%

A Closed-Loop CPR Training Glove with Integrated Tactile Sensing and Haptic Feedback

闭环式带集成触觉感知与触觉反馈的CPR训练手套

Jaeyoung Moon, Mingzhuo Ma, Qifeng Yang, Youjin Choi, Seokhyun Hwang, Samuel Burden, Kyung-Joong Kim, Yiyue Luo

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出了一种闭环CPR训练手套,通过集成触觉感知和触觉反馈,提升自主练习中的CPR质量与准确性。

Comments 8pages, 10 figures, This paper is accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00789 2026-03-09 physics.app-ph physics.flu-dyn 50%

Aeroacoustic signatures reveal fast transient dynamics of vapor-jet-driven cavity oscillations in metallic additive manufacturing

气动声学特征揭示金属增材制造中蒸发喷射驱动腔体振荡的快速瞬态动力学

Haolin Liu, S. Kiana Naghibzadeh, Zhongshu Ren, Yanming Zhang, Jiayun Shao, Samuel J. Clark, Kamel Fezzaa, Xuzhe Zeng, Lin Gao, Wentao Yan, Noel Walkington, Kaushik Dayal, Tao Sun, Anthony D. Rollett, Levent Burak Kara

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 该研究通过气动声学特征揭示金属增材制造中蒸发喷射驱动的腔体振荡快速瞬态动力学,利用声学信号耦合瞬时腔体深度和振荡频率,重新定义蒸发过程的临界频率事件。

Comments 35 pages 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07619 2026-03-09 cs.RO 50%

CAVER: Curious Audiovisual Exploring Robot

CAVER:好奇的视听探索机器人

Luca Macesanu, Boueny Folefack, Samik Singh, Ruchira Ray, Ben Abbatematteo, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 CAVER是一种新型机器人,通过好奇心驱动的探索算法和多模态视听表示,提升材料分类和音频示范模仿的性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14063 2026-03-09 cs.RO 50%

Language Conditioning Improves Accuracy of Aircraft Goal Prediction in Non-Towered Airspace

语言引导提升非塔台空域飞机目标预测的准确性

Sundhar Vinodh Sangeetha, Chih-Yuan Chiu, Sarah H. Q. Li, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院) School of Aerospace Engineering(航空航天工程学院) School of Electrical and Computer Engineering(电气与计算机工程学院) School of Mechanical Engineering(机械工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出利用语言信息提升非塔台空域飞机目标预测准确性的多模态框架,通过整合自然语言理解和空间推理,有效提高自主决策能力。

Comments The last two authors advised equally. Accepted to the 2026 IEEE International Conference on Robotics and Automation. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12386 2026-03-04 cs.HC 50%

Hey Dashboard!: Supporting Voice, Text, and Pointing Modalities in Dashboard Onboarding

Hey Dashboard!:在仪表盘引导中支持语音、文本和指向模态

Vaishali Dhanoa, Gabriela Molina León, Eve Hoggan, Eduard Gröller, Marc Streit, Niklas Elmqvist

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 DIANA通过语音、文本和指向等多种模态,为仪表盘引导提供自助导航和分析支持,提升用户在复杂仪表盘中的使用效率。

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22131 2026-02-26 cs.HC 50%

Giving Meaning to Movements: Challenges and Opportunities in Expanding Communication by Pairing Unaided AAC with Speech Generated Messages

为动作赋予意义:通过将无辅助AAC与语音生成信息结合扩展沟通的挑战与机遇

Imran Kabir, Sharon Ann Redmon, Lynn R Elko, Kevin Williams, Mitchell A Case, Dawn J Sowers, Krista Wilkinson, Syed Masum Billah

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出AllyAAC系统,通过结合无辅助AAC与语音生成信息,解决个性化肢体动作识别挑战,提升沟通效率与可理解性。

Comments To appear in Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD 50%

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12918 2026-02-16 cs.RO 50%

Adding internal audio sensing to internal vision enables human-like in-hand fabric recognition with soft robotic fingertips

添加内部音频感知至内部视觉可使软机器人指尖实现类人手持织物识别

Iris Andrussow, Jans Solano, Benjamin A. Richardson, Georg Martius, Katherine J. Kuchenbecker

机构 * Haptic Intelligence Department, Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所人机交互部门) Department for Distributed Intelligence / Autonomous Learning, University of Tübingen(图宾根大学分布式智能/自主学习部门)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本研究通过结合内部视觉和音频感知,使软机器人指尖实现类人织物识别,利用变压器方法在 20 种常见织物上达到 97% 分类准确率。

Journal ref 2025 IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13148 2026-02-16 cs.SD 50%

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

大音频语言模型能理解音频吗?LALMs的语音、场景和事件理解基准

Han Yin, Jung-Woo Choi

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学电气工程学院)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出SSEU-Bench,首个考虑语音与非语音音频能量差异的音频理解基准,通过链式思维提升LALMs在联合理解任务中的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11906 2026-02-16 cs.RO 50%

Palpation Alters Auditory Pain Expressions with Gender-Specific Variations in Robopatients

触诊改变与性别相关的听觉疼痛表达在仿生患者中

Chapa Sirithunge, Yue Xie, Saitarun Nadipineni, Fumiya Iida, Thilina Dulantha Lalitharatne

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) School of Engineering and Materials Science in Queen Mary University of London(伦敦大学玛丽女王学院工程与材料科学学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种基于人类在环强化学习的仿生患者听觉疼痛表达生成方法,通过动态调整触诊力与声音反馈的关系,实现性别差异的个性化疼痛表达,以提升医疗模拟训练效果。

Comments 12 pages, 9 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12416 2026-02-16 cs.RO cs.SY eess.SY 50%

Control Barrier Functions with Audio Risk Awareness for Robot Safe Navigation on Construction Sites

具有音频风险意识的控制障碍函数用于建筑工地机器人安全导航

Johannes Mootz, Reza Akhavian

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种基于控制障碍函数的机器人安全导航方法,通过音频风险提示增强避障能力,有效提升建设工地环境下的自主导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08930 2026-02-13 cs.SD 50%

No Word Left Behind: Mitigating Prefix Bias in Open-Vocabulary Keyword Spotting

无词遗留:减轻开放式词汇关键词定位中的前缀偏差

Yi Liu, Chuan-Che Huang, Xiao Quan

机构 * University of California San Diego, Dept. of Electrical and Computer Engineering(加州大学圣迭戈分校电子与计算机工程系) Bose Corporation(博世公司)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出EPS方法,通过减轻开放式词汇关键词定位中的前缀偏差,显著提升识别准确率,同时保持其他数据集的性能。

Comments Published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07266 2026-02-10 cs.HC 50%

ADCanvas: Accessible and Conversational Audio Description Authoring for Blind and Low Vision Creators

ADCanvas: 为视障和低视力创作者提供可访问且对话式的音频描述创作工具

Franklin Mingzhe Li, Michael Xieyang Liu, Cynthia L. Bennett, Shaun K. Kane

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ADCanvas为视障和低视力创作者提供可访问且对话式的音频描述创作工具,通过多模态交互支持端到端的AD创作和视觉问答。

Comments 21 pages, 4 figures, published in CHI '26

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02602 2026-02-04 cs.CR cs.LG 50%

Position: 3D Gaussian Splatting Watermarking Should Be Scenario-Driven and Threat-Model Explicit

位置:3D高斯散射水印应基于场景驱动和威胁模型明确

Yangfan Deng, Anirudh Nakra, Min Wu

机构 * University of Maryland, College Park, MD, United States(马里兰大学学院公园分校)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文主张3D资产水印技术应基于场景驱动和威胁模型明确,以提升知识产权保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01559 2026-01-30 cs.SD 50%

LLM2Fx-Tools: Tool Calling For Music Post-Production

LLM2Fx-Tools: 音乐后期制作中的工具调用

Seungheon Doh, Junghyun Koo, Marco A. Martínez-Ramírez, Woosung Choi, Wei-Hsiang Liao, Qiyu Wu, Juhan Nam, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 LLM2Fx-Tools通过LLM实现音频效果模块的工具调用,生成可执行的音频效果序列,提升音乐后期制作的可解释性和可控性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19281 2026-01-28 cs.HC 50%

Gazeify Then Voiceify: Physical Object Referencing Through Gaze and Voice Interaction with Displayless Smart Glasses

通过眼动和语音交互实现无显示屏智能眼镜的物理物体指认

Zheng Zhang, Mengjie Yu, Tianyi Wang, Kashyap Todi, Ajoy Savio Fernandes, Yue Liu, Haijun Xia, Tovi Grossman, Tanya Jonker

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 无显示屏智能眼镜通过眼动和语音交互实现物理物体指认,结合先进分割与视觉-语言模型,提升交互准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17287 2026-01-27 cs.RO 50%

Real-Time Synchronized Interaction Framework for Emotion-Aware Humanoid Robots

面向情感感知人形机器人的实时同步交互框架

Yanrong Chen, Xihan Bian

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种实时框架,通过双通道情感引擎、动态时间规整和闭环验证,实现人形机器人的情感同步交互,提升在医疗、教育等动态场景中的应用能力。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14357 2026-01-26 astro-ph.IM 50%

One Attempt at Building an Inclusive & Accessible Hybrid Astronomy Conference: FRB 2025

一次构建包容与可及性混合天文学会议的尝试:FRB 2025

Alice P. Curtin, Reshma Anna-Thomas, Amanda M. Cook, Carolina Cruz-Vinaccia, Jason Hessels, Robert Main, Inés Pastor Marazuela, Lauren Rhodes, Vishwangi Shah

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 FRB 2025会议通过混合模式、低费用和教育活动,为早期研究人员和欠资地区提供可及性,展示了低成本高包容性的会议可能性。

Comments 10 pages, 4 figures; Conference Reflection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08422 2026-01-22 cs.RO 50%

Teaching Robots Like Dogs: Learning Agile Navigation from Luring, Gesture, and Speech

教机器人像教狗一样:从诱饵、手势和言语中学习敏捷导航

Taerim Yoon, Dongho Kang, Jin Cheng, Fatemeh Zargarbashi, Yijiang Huang, Minsung Ahn, Stelian Coros, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究提出了一种人机协同框架,通过手势、言语和诱饵等多模态输入,使机器人高效学习敏捷导航,实验显示在少于1小时的数据下任务成功率高达97.15%。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13355 2026-01-21 cs.HC 50%

Remote Triggers: Misophonia, Technology Non-Use, and Design for Inclusive Digital Spaces

远程触发:对声音厌恶、技术不使用与包容性数字空间的设计

Tawfiq Ammari, Samantha Gilgan

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本研究探讨声音厌恶者在数字空间中的体验,提出设计干预以减少技术不使用和排斥问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11328 2026-01-21 cs.HC 50%

ProjecTA: A Semi-Humanoid Robotic Teaching Assistant with In-Situ Projection for Guided Tours

ProjecTA:一种配备现场投影的半人形教学助手用于导览

Hanqing Zhou, Yichuan Zhang, Zihan Zhang, Wei Zhang, Chao Wang, Pengcheng An

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 ProjecTA通过现场投影与手势协调,减少认知负荷并提升学习体验,为移动学习提供新的设计方向。

Comments 35 pages, 12 figures, 2 appendixes, 3 supplementary meterials, to appear at ACM CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11262 2026-01-19 cs.SD cs.IR cs.LG 50%

Scalable Music Cover Retrieval Using Lyrics-Aligned Audio Embeddings

基于歌词对齐音频嵌入的可扩展音乐封面检索

Joanne Affolter, Benjamin Martin, Elena V. Epure, Gabriel Meseguer-Brocal, Frédéric Kaplan

机构 * Deezer Research, Paris, France(DeepZoom研究机构,法国巴黎) EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 LIVI通过利用歌词信息提升音乐封面检索的准确性和效率,减少对复杂模型的依赖。

Comments Published at ECIR 2026 (European Conference of Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10119 2026-01-16 cs.CR 50%

Advanced Encryption Technique for Multimedia Data Using Sudoku-Based Algorithms for Enhanced Security

基于数独算法的多媒体数据高级加密技术

Mithil Bavishi, Anuj Bohra, Kushal Vadodaria, Abhinav Bohra, Neha Katre, Ramchandra Mangrulkar, Vinaya Sawant

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种基于数独算法的高级加密技术,用于增强多媒体数据的安全性,通过时间戳依赖密钥生成并支持多种媒体类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06774 2026-01-13 cs.HC 50%

ImmuniFraug: A Metacognitive Intervention Anti-Fraud Approach to Enhance Undergraduate Students' Cyber Fraud Awareness

ImmuniFraug:一种基于元认知干预的反欺诈方法,以提高本科生的网络欺诈意识

Xiangzhe Yuan, Jiajun Wang, Huanchen Wang, Qian Wan, Siying Hu

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ImmuniFraug通过基于LLM的多模态欺诈模拟,提升本科生网络欺诈意识和自我效能感,提供更有效的反欺诈教育方法。

详情

展开后加载摘要…

URL PDF HTML 收藏