AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning
AffordAny:基于单目RGB图像的开放世界3D affordance grounding,通过视觉-语言引导的几何推理实现
专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 AffordAny是端到端框架,通过单目RGB图像结合VLM引导解码器与伪标签自训练,实现开放世界3D affordance grounding,在未见对象、类别等评估中表现出有效性与鲁棒性。
Comments The code and dataset are publicly available. Code: this https URL (https://github.com/lzlfwow/AffordAny). Dataset: this https URL (https://modelscope.cn/datasets/lzlfwow/AffordAny)