arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-02 至 2026-02-02 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2601.22508 2026-02-02 cs.CV 79%

CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content

CoVA: 基于文本引导的复合视频检索用于音频视觉内容

Gyuwon Han, Young Kyun Jang, Chanho Eom

专题命中 音频语音多模态 :audio-visual(title);cross-modal(abstract);分类 cs.CV

AI总结 CoVA通过整合视频、音频和文本特征,解决音频视觉内容检索中的跨模态变化问题,提出AVT复合融合方法并构建AV-Comp基准。

Comments Please visit our project page at https://perceptualai-lab.github.io/CoVA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10754 2026-02-02 cs.SD cs.AI eess.AS 62%

BNMusic: Blending Environmental Noises into Personalized Music

BNMusic: 将环境噪音融入个性化音乐

Chi Zuo, Martin B. Møller, Pablo Martínez-Nuevo, Huayang Huang, Yu Wu, Ye Zhu

机构 * Wuhan University(武汉大学) Bang & Olufsen A/S(Bang & Olufsen公司) Princeton University(普林斯顿大学) LIX, École Polytechnique(巴黎政治学院LIX研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 BNMusic通过将环境噪音融入个性化音乐生成,减少噪音的明显性,提升听觉体验。

Comments This paper has been accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏