arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2608.27785 2026-08-31 cs.CL cs.AI 新提交 88%

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

音频-视觉大型语言模型中的组合式失效:跨模态冲突下的深层先验主导

Adarsh Sudheer, David Li, Omar Elbanna, Ishaan Kodarapu, Arjun Bahuguna, Vasu Sharma

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对AV-LLMs,以音频-视觉冲突为组合泛化测试,发现模型存在先验主导的组合式失效,开展可解释性分析并验证时间对齐无法提升冲突解决能力,提供了相关代码与数据。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-08-31 cs.CV 版本更新 83%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments ECCV 2026 camera-ready version. Project page: this https URL (https://vision.cs.utexas.edu/projects/acpo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28212 2026-08-31 cs.MM cs.SD 新提交 79%

MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance

MuSP-Bench:面向乐谱与演奏的高级多模态音乐理解基准测试

Milan Liessens Dujardin, Song-Ze Yu, Kevin Miao

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 研究人员推出MuSP-Bench基准测试,含490个乐谱与演奏理解问题,评估发现前沿多模态大语言模型理解乐谱困难,推理演奏音频时挑战更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-08-31 eess.AS cs.AI cs.SD 版本更新 62%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Contents updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28040 2026-08-31 cs.CL cs.SD 新提交 57%

A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls

颤抖的声音并非总是遁词:对财报电话会议中文本与声音规避检测的基准测试

Mirae Kim, Seonghun Jeong, Youngjun Kwak

机构 * KakaoBank Corp.(Kakao银行股份有限公司) Yonsei University(延世大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对财报电话会议问答环节,构建了含505个问答对的DualEvasion基准,发现现有多模态模型难以检测声音置信度,孤立解读声学线索,与人类性能差距显著。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12817 2026-08-31 eess.SP cs.SD 版本更新 50%

An Attention-Assisted AI Model for Real-Time Underwater Sound Speed Estimation Leveraging Remote Sensing Sea Surface Temperature Data

一种结合注意力机制的多模态数据融合模型用于实时估计水下声速

Pengfei Wu, Wei Huang, Yujie Shi, Feng Yin, Hao Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) School of Environmental Science and Engineering, Ocean University of China(中国海洋大学环境科学与工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种结合注意力机制的多模态数据融合卷积神经网络,用于实时估计水下声速剖面,通过提取远程感应海面温度数据与历史声速剖面特征之间的关系,提升估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏