Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
机构 * Georgia Tech(佐治亚理工学院) ; NVIDIA(英伟达)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI