arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-16 至 2026-02-16 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2602.12597 2026-02-16 cs.RO cs.HC 78%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07969 2026-02-16 eess.AS cs.AI cs.LG cs.SD 62%

Tuberculosis Screening from Cough Audio: Baseline Models, Clinical Variables, and Uncertainty Quantification

咳嗽音频中肺结核筛查:基线模型、临床变量和不确定性量化

George P. Kafentzis, Efstratios Selisios

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出了一种标准化框架,用于通过咳嗽音频和临床数据检测肺结核,通过建立基线模型和量化不确定性,提供公平比较的参考点。

Comments Updated to published version in Sensors; DOI: 10.3390/s26041223

Journal ref Sensors 2026, 26(4), 1223

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12302 2026-02-16 cs.CL cs.CV 62%

Grandes Modelos de Linguagem Multimodais (MLLMs): Da Teoria à Prática

大规模多模态语言模型(MLLMs):从理论到实践

Neemias da Silva, Júlio C. W. Scholz, John Harrison, Marina Borges, Paulo Ávila, Frances A Santos, Myriam Delgado, Rodrigo Minetto, Thiago H Silva

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文介绍了多模态大语言模型(MLLMs)的理论基础和实践方法,探讨了预处理、提示工程及多模态管道构建技术,并提供了补充材料供进一步研究。

Comments in Portuguese language. Accepted book chapter - Webmedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12918 2026-02-16 cs.RO 50%

Adding internal audio sensing to internal vision enables human-like in-hand fabric recognition with soft robotic fingertips

添加内部音频感知至内部视觉可使软机器人指尖实现类人手持织物识别

Iris Andrussow, Jans Solano, Benjamin A. Richardson, Georg Martius, Katherine J. Kuchenbecker

机构 * Haptic Intelligence Department, Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所人机交互部门) Department for Distributed Intelligence / Autonomous Learning, University of Tübingen(图宾根大学分布式智能/自主学习部门)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本研究通过结合内部视觉和音频感知,使软机器人指尖实现类人织物识别,利用变压器方法在 20 种常见织物上达到 97% 分类准确率。

Journal ref 2025 IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13148 2026-02-16 cs.SD 50%

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

大音频语言模型能理解音频吗?LALMs的语音、场景和事件理解基准

Han Yin, Jung-Woo Choi

机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学电气工程学院)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出SSEU-Bench,首个考虑语音与非语音音频能量差异的音频理解基准,通过链式思维提升LALMs在联合理解任务中的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11906 2026-02-16 cs.RO 50%

Palpation Alters Auditory Pain Expressions with Gender-Specific Variations in Robopatients

触诊改变与性别相关的听觉疼痛表达在仿生患者中

Chapa Sirithunge, Yue Xie, Saitarun Nadipineni, Fumiya Iida, Thilina Dulantha Lalitharatne

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) School of Engineering and Materials Science in Queen Mary University of London(伦敦大学玛丽女王学院工程与材料科学学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种基于人类在环强化学习的仿生患者听觉疼痛表达生成方法,通过动态调整触诊力与声音反馈的关系,实现性别差异的个性化疼痛表达,以提升医疗模拟训练效果。

Comments 12 pages, 9 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12416 2026-02-16 cs.RO cs.SY eess.SY 50%

Control Barrier Functions with Audio Risk Awareness for Robot Safe Navigation on Construction Sites

具有音频风险意识的控制障碍函数用于建筑工地机器人安全导航

Johannes Mootz, Reza Akhavian

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种基于控制障碍函数的机器人安全导航方法,通过音频风险提示增强避障能力,有效提升建设工地环境下的自主导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏