A Training-Free Guess What Vision Language Model from Snippets to Open-Vocabulary Object Detection
无需训练的Guess What视觉语言模型:从片段到开放词汇物体检测
机构 * Aerospace and Informatics Domain(航空航天与信息领域) ; National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(空间智能信息处理国家级重点实验室) ; School of Electronic(电子学院)
专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出无需训练的Guess What视觉语言模型GW-VLM,通过多尺度视觉语言搜索与上下文概念提示实现开放词汇物体检测的高效检测性能。