arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-23 至 2026-02-23 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2508.11936 2026-02-23 cs.LG 82%

M3OOD: Automatic Selection of Multimodal OOD Detectors

M3OOD:多模态OOD检测器的自动选择

Yuehan Qin, Li Li, Defu Cao, Tiankai Yang, Jiate Li, Yue Zhao

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 M3OOD通过元学习框架自动选择多模态OOD检测器,有效提升不同分布偏移下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17769 2026-02-23 cs.MM cs.SD eess.AS 73%

MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions

MusicSem: 一种语义丰富的语言-音频数据集,用于自然音乐描述

Rebecca Salganik, Teng Tu, Fei-Yueh Chen, Xiaohao Liu, Keifeng Lu, Ethan Luvisia, Zhiyao Duan, Guillaume Salha-Galvan, Anson Kahng, Yunshan Ma, Jian Kang

机构 * University of Rochester(罗切斯特大学) National University of Singapore(新加坡国立大学) SJTU Paris Elite Institute of Technology(上海科技技术巴黎精英学院) Singapore Management University(新加坡管理学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.MM、eess.AS

AI总结 MusicSem是一个基于Reddit讨论的语义丰富的音乐描述数据集,旨在提升多模态音乐表示学习中对细粒度语义的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏