SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision
SpatialSV: 通过任务导向的视觉监督在多模态大语言模型中内化可解释的3D空间感知
机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
AI总结 提出SpatialSV框架,通过任务导向的视觉监督将MLLM的2D特征提升为显式3D表示(深度图、相机姿态、点云),实现可解释的3D空间感知内化,无需外部工具,并在半监督设置中展现强泛化能力。
Comments Accepted by IJCAI 2026