论文导读
韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等机构提出Imagine3D-LLM,让多模态大模型回答前先把多视角照片压成紧凑三维场景。它在多项空间推理和3D理解基准上持续超过既有方法,证明粗略“脑补”场景比只对齐像素更有效。
多张照片不等于一个空间
多模态大模型能看懂单张图片,却常把不同视角中的同一把椅子当成两个对象,也难判断相机之间的位置。现有方案要么加强像素级对应,要么把外部三维模型的特征塞进语言模型;信息更细,却不一定形成可供推理的整体布局。
图:多张室内照片与解码出的紧凑三维高斯场景并列展示。
Imagine3D-LLM借鉴人的做法:先识别各视角共有物体,估计相对方向,再拼出一个大致场景。模型并不追求摄影测量级重建,而是生成足够回答前后、远近、遮挡和位置关系的内部三维草图。
少量摘要Token承载三维草图
团队在图像Token后加入少量可学习的摘要Token,并把它们解码成紧凑的3D高斯表示。训练时,照片重建损失监督这些摘要Token,语言回答仍使用常规的下一Token预测目标;最终回答会以这份三维表示为条件。
图:架构图说明图像Token经摘要Token生成三维表示再辅助回答。
虽然直接重建监督只落在摘要Token上,实验发现语言模型内部图像特征的跨视角对应也变强。换句话说,要求模型真正拼出一个可渲染场景,会反过来整理它对不同照片关系的理解。
重建服务于回答而非建模
项目样例把多视角室内照片和解码出的3D高斯场景并排展示。后者可能粗糙,却保留了主要物体和相对布局;注意力图还显示,模型在不同视角中更集中地寻找对应区域。
图:跨视角热区显示模型在多张照片中寻找相同场景区域。
论文在多项空间推理和3D理解基准上持续优于既有方法。这里验证的是基准问题与紧凑场景表示,不是把任意真实环境完整重建成可直接用于建筑或测绘的模型;摘要Token容量也决定了细节上限。
先想象再回答可扩展到行动
对室内导航、机器人问答和房产空间检索,这种中间表示让模型的答案有一个可检查的空间依据。系统可以先显示粗略三维布局,再说明“物体在左侧”或“从另一视角被遮挡”,比只输出一句结论更容易发现错误。
下一步可加入视频时间线、动态物体和不确定性,让模型在视角不足时承认看不清并请求新照片。若紧凑三维草图能与规划器连接,多模态大模型就不只是在图片上回答问题,还能围绕一个共享空间表示决定下一步观察或行动。部署时还应标记重建置信度,防止粗略布局被误当成精确尺寸。