VoxRep: Enhancing 3D Spatial Understanding in 2D Vision-Language Models via Voxel Representation
VoxRep:通过体素表示增强2D视觉-语言模型的3D空间理解
机构 * Menlo Research(Menlo研究)
专题命中 医疗多模态 :CT(abstract);分类 cs.CV
AI总结 本文提出VoxRep方法,通过将体素空间切分为2D切片并输入预训练的视觉-语言模型,实现对3D环境的高效语义理解。
Journal ref Proc. APSIPA ASC 2025, pp. 1464-1469