SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理
机构 * Huawei(华为) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Hong Kong(香港大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。