Scaling Audio-Text Retrieval with Multimodal Large Language Models
通过多模态大语言模型扩展音频-文本检索
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) ; Epidemic Sound ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。
Comments Technical Report