Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
Spatial-MLLM: 提升基于视觉的空域智能的MLLM能力
机构 * Tsinghua University(清华大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Spatial-MLLM,一种基于纯2D观测的视觉空域推理框架,通过双编码器架构和空间感知帧采样策略提升空域理解能力,实验表明其在多种视觉空域任务中达到SOTA性能。
Comments 22 pages