Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
抽象3D感知用于视觉-语言模型中的空间智能
机构 * Tsinghua University(清华大学) ; Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 机器人数据与评测 :robotics(abstract);embodied agent(abstract);分类 cs.CV
AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。