arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-02 至 2026-03-02 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2602.24195 2026-03-02 cs.AI cs.CL cs.CV cs.LG 85%

Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume

多模态大语言模型的不确定性量化:基于不一致性调整的语义体积

Gregory Kang Ruey Lau, Hieu Dao, Nicole Kan Hui Lin, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UMPIRE是一种无需训练的多模态大语言模型不确定性量化框架,通过内部特征有效捕捉语义多样性和响应不一致性,提升错误检测和不确定性校准性能。

Comments Earlier versions presented at ICLR 2025 QUESTION workshop and ICML 2025 R2-FM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23994 2026-03-02 cs.LG cs.AI cs.CV 84%

MINT: Multimodal Imaging-to-Speech Knowledge Transfer for Early Alzheimer's Screening

MINT:多模态影像到语音知识迁移用于早期阿尔茨海默病筛查

Vrushank Ahire, Yogesh Kumar, Anouck Girard, M. A. Ganaie

机构 * Department of CSE, Indian Institute of Technology Ropar(印度理工学院罗帕尔计算机科学与工程系) Embry-Riddle Aeronautical University(埃姆布里-瑞尔德航空大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MINT通过多模态知识迁移,利用MRI生物标志物提升语音识别的阿尔茨海默病早期筛查性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23393 2026-03-02 cs.SD cs.CV 83%

Leveraging large multimodal models for audio-video deepfake detection: a pilot study

利用大型多模态模型进行音频视频深度伪造检测:一项试点研究

Songjun Cao, Yuqi Li, Yunpeng Luo, Jianjun Yin, Long Ma

机构 * Tencent Youtu Lab(腾讯优图实验室) Fudan University(复旦大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出AV-LMMDetect,利用大型多模态模型进行音频视频深度伪造检测,通过监督微调和分阶段训练,在多个数据集上达到新的性能水平。

Comments 5pages,ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD 81%

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09658 2026-03-02 cs.HC 78%

Co-Designing Multimodal Systems for Accessible Asynchronous Dance Instruction

为无障碍异步舞蹈教学设计多模态系统

Ujjaini Das, Shreya Kappala, Meng Chen, Mina Huh, Amy Pavel

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文通过协同设计研讨会,探讨了如何通过多模态系统为盲人和低视力学习者提供无障碍异步舞蹈教学。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23747 2026-03-02 cs.HC 71%

Feelings, Not Feel: Affective Audio-Visual Pseudo-Haptics in Hand-Tracked XR

感受,而非感受:手部追踪XR中的情感音频视觉伪触觉

Kristian Paolo David, Tyrone Justin Sta Maria, Mikkel Dominic Gamboa, Jordan Aiko Deja

专题命中 音频语音多模态 :audio-visual(title)

AI总结 该研究探讨了在无控制器的XR环境中,通过伪触觉线索(音频、视觉)影响用户情感体验的机制,发现其更应视为情感反馈而非直接触觉替代。

Comments 5 pages, 2 figures, 1 table, CHI EA Posters

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23649 2026-03-02 cs.SD cs.AI 57%

AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech

AudioCapBench: 音频描述能力的快速评估:涵盖声音、音乐和语音

Jielin Qiu, Jianguo Zhang, Zixiang Chen, Liangwei Yang, Ming Zhu, Juntao Tan, Haolin Chen, Wenting Zhao, Rithesh Murthy, Roshan Ram, Akshara Prabhakar, Shelby Heinecke, Caiming, Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AudioCapBench通过对比不同模型在环境声音、音乐和语音描述任务中的表现,评估了大模型的音频描述能力,揭示Gemini模型在整体质量上优于OpenAI模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏