N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理
机构 * HKUST(香港科技大学) ; Tencent AI Lab(腾讯AI实验室) ; CUHK(香港中文大学) ; ZJU(浙江大学) ; NJU(南京大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。
Comments Project Page: https://n3d-vlm.github.io