Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2025; 27 pages, 6 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2025; 27 pages, 6 figures
机构 * School of Electrical and Computer Engineering, The University of Sydney(电气与计算机工程学院,悉尼大学) ; School of Computer Science, The University of Adelaide(计算机科学学院,阿德莱德大学) ; School of Computing and Information Technology, University of Wollongong(计算与信息科技学院,沃伦冈大学)
专题命中 其他VLM :vision language model(abstract);分类 cs.CV
机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; NVIDIA AI Technology Center, NVIDIA(NVIDIA 人工智能技术中心)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2025