arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-13 至 2026-02-13 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2602.11596 2026-02-13 cs.AI 70%

MAPLE: Modality-Aware Post-training and Learning Ecosystem

MAPLE: 多模态感知的后训练与学习生态系统

Nikhil Verma, Minjung Kim, JooYoung Yoo, Kyung-Min Jin, Manasa Bharadwaj, Kevin Ferreira, Ko Keun Kim, Youngjoon Kim

机构 * LG Electronics Toronto AI Lab, Toronto, Canada(LG电子多伦多AI实验室) LG Electronics CTO AI Lab, Seoul, Republic of Korea(LG电子CTO AI实验室)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 MAPLE通过模态感知的后训练与学习生态系统,提升多模态强化学习的准确性、收敛速度和稳定性。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10078 2026-02-13 cs.SD cs.LG 67%

Improving Speech Emotion Recognition with Mutual Information Regularized Generative Model

通过互信息正则化生成模型改进语音情感识别

Chung-Soo Ahn, Rajib Rana, Sunil Sivadas, Carlos Busso, Jagath C. Rajapakse

机构 * College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院) University of Southern Queensland(南方昆士兰大学) NCS Group(NCS集团) Language Technologies Institute, School of Computer Science, Carnegie Mellon University(计算机科学学院语言技术研究所,卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出了一种基于互信息正则化的生成模型,通过跨模态对齐和特征合成提升语音情感识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09378 2026-02-13 cs.SD cs.AI cs.MM eess.AS 67%

Prevailing Research Areas for Music AI in the Era of Foundation Models

基础模型时代音乐AI的主流研究领域

Megan Wei, Mateusz Modrzejewski, Aswin Sivaraman, Dorien Herremans

机构 * Brown University(布朗大学) Warsaw University of Technology(华沙技术大学) Indiana University(印第安纳大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文探讨了基础模型时代音乐AI的研究领域,涵盖基础模型、多模态系统、数据集、效率、生成模型应用及版权问题,旨在揭示未来研究方向。

Journal ref Proceedings of Machine Learning Research, PMLR 303:1-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11941 2026-02-13 cs.IR cs.AI 57%

IncompeBench: A Permissively Licensed, Fine-Grained Benchmark for Music Information Retrieval

IncompeBench: 一个宽松许可、细粒度的音乐信息检索基准

Benjamin Clavié, Atoof Shakir, Jonah Turner, Sean Lee, Aamir Shakir, Makoto P. Kato

机构 * National Institute of Informatics (NII)(日本国立信息学研究所) ETHZ(苏黎世联邦理工学院) University of Tsukuba(茨口大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 IncompeBench提供了一个高质量、宽松许可的音乐信息检索基准,包含大量标注数据和多样化查询,用于评估和改进音乐检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04899 2026-02-13 cs.AI 57%

Human Behavior Atlas: Benchmarking Unified Psychological and Social Behavior Understanding

人类行为图谱:统一心理与社会行为理解的基准测试

Keane Ong, Wei Dai, Carol Li, Dewei Feng, Hengzhi Li, Jingyao Wu, Jiaee Cheong, Rui Mao, Gianmarco Mengaldo, Erik Cambria, Paul Pu Liang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 人类行为图谱通过统一基准和三种模型提升心理与社会行为理解的多模态性能

Comments Accepted to ICLR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08930 2026-02-13 cs.SD 50%

No Word Left Behind: Mitigating Prefix Bias in Open-Vocabulary Keyword Spotting

无词遗留:减轻开放式词汇关键词定位中的前缀偏差

Yi Liu, Chuan-Che Huang, Xiao Quan

机构 * University of California San Diego, Dept. of Electrical and Computer Engineering(加州大学圣迭戈分校电子与计算机工程系) Bose Corporation(博世公司)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出EPS方法,通过减轻开放式词汇关键词定位中的前缀偏差,显著提升识别准确率,同时保持其他数据集的性能。

Comments Published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏