Scaling Audio-Text Retrieval with Multimodal Large Language Models
通过多模态大语言模型扩展音频-文本检索
Jilan Xu, Carl Thomé, Danijela Horak, Weidi Xie, Andrew Zisserman
机构
*
Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
;
Epidemic Sound
;
School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
机构
*
University of Rochester(罗切斯特大学)
;
National University of Singapore(新加坡国立大学)
;
SJTU Paris Elite Institute of Technology(上海科技技术巴黎精英学院)
;
Singapore Management University(新加坡管理学院)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦
Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du
机构
*
National University of Defense Technology, China(国防科技大学)
;
Beijing University of Posts and Telecommunications, China(北京邮电大学)
;
University of the Chinese Academy of Sciences, China(中国科学院大学)
;
Shanghai Jiao Tong University, China(上海交通大学)
;
Wuhan University, China(武汉大学)
;
Chinese Academy of Science, China(中国科学院)
;
Tsinghua University, China(清华大学)
;
Renmin University of China, China(中国人民大学)