S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.AI
AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。
Comments 18 pages, 9 figures