EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval
机构 * MBZUAI(马尔堡人工智能研究所)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * MBZUAI(马尔堡人工智能研究所)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
机构 * ALTA Institute(ALTA研究院) ; Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted to the EMNLP 2025 BabyLM Workshop
机构 * Tokyo University of Science(东京科学大学) ; National University of Singapore(新加坡国立大学) ; National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) ; University of Oxford(牛津大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2025 (Spotlight)
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Sensetime Research(商汤科技研究院) ; Nanjing University(南京大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025. 22 pages, link: https://github.com/OpenGVLab/NaViL
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI
Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2025
机构 * University of Southern California(美国南加州大学)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Hong Kong Polytechnic University(香港理工大学) ; Zhuhai Campus of Sun Yat-sen University(中山大学珠海校区) ; University of Adelaide(阿德莱德大学) ; Peking University(北京大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 VLM训练与架构 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV
机构 * NetoAI
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
Comments Accepted to EMNLP 2025 (Industry Track)
机构 * MaiNLP & MCML, LMU Munich, Germany(LMU慕尼黑媒体与传播系) ; Department of Media and Communication, LMU Munich, Germany(LMU慕尼黑媒体与传播系) ; National Research Council Canada, Ottawa, Canada(加拿大国家研究委员会)
专题命中 VLM训练与架构 :LLaVA(abstract)
Comments 20 pages, 9 figures, EMNLP Findings
机构 * Stanford University(斯坦福大学) ; Harvard University(哈佛大学)
专题命中 其他VLM :visual language model(abstract);分类 cs.CV、cs.AI
Comments Project page: https://product-of-experts.github.io/