Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
无需词汇的细粒度视觉识别 via 增强的上下文感知视觉语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出E-FineR方法,无需词汇实现细粒度视觉识别,提供高可解释性和在零样本和少样本分类中的高性能。
Comments Accepted to ICCV 2025