arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

看懂多视角还不够:Google等团队让大模型先在脑中拼一遍3D

作者:arXivDaily编辑部 arXiv 2609.38177 cs · cs.CL · cs.CV

论文导读

韩国科学技术院、苏黎世联邦理工学院、Google、慕尼黑工业大学等机构提出Imagine3D-LLM,让多模态大模型回答前先把多视角照片压成紧凑三维场景。它在多项空间推理和3D理解基准上持续超过既有方法,证明粗略“脑补”场景比只对齐像素更有效。

多张照片不等于一个空间

多模态大模型能看懂单张图片,却常把不同视角中的同一把椅子当成两个对象,也难判断相机之间的位置。现有方案要么加强像素级对应,要么把外部三维模型的特征塞进语言模型;信息更细,却不一定形成可供推理的整体布局。

图:多张室内照片与解码出的紧凑三维高斯场景并列展示。

Imagine3D-LLM借鉴人的做法:先识别各视角共有物体,估计相对方向,再拼出一个大致场景。模型并不追求摄影测量级重建,而是生成足够回答前后、远近、遮挡和位置关系的内部三维草图。

少量摘要Token承载三维草图

团队在图像Token后加入少量可学习的摘要Token,并把它们解码成紧凑的3D高斯表示。训练时,照片重建损失监督这些摘要Token,语言回答仍使用常规的下一Token预测目标;最终回答会以这份三维表示为条件。

图:架构图说明图像Token经摘要Token生成三维表示再辅助回答。

虽然直接重建监督只落在摘要Token上,实验发现语言模型内部图像特征的跨视角对应也变强。换句话说,要求模型真正拼出一个可渲染场景,会反过来整理它对不同照片关系的理解。

重建服务于回答而非建模

项目样例把多视角室内照片和解码出的3D高斯场景并排展示。后者可能粗糙,却保留了主要物体和相对布局;注意力图还显示,模型在不同视角中更集中地寻找对应区域。

图:跨视角热区显示模型在多张照片中寻找相同场景区域。

论文在多项空间推理和3D理解基准上持续优于既有方法。这里验证的是基准问题与紧凑场景表示,不是把任意真实环境完整重建成可直接用于建筑或测绘的模型;摘要Token容量也决定了细节上限。

先想象再回答可扩展到行动

对室内导航、机器人问答和房产空间检索,这种中间表示让模型的答案有一个可检查的空间依据。系统可以先显示粗略三维布局,再说明“物体在左侧”或“从另一视角被遮挡”,比只输出一句结论更容易发现错误。

下一步可加入视频时间线、动态物体和不确定性,让模型在视角不足时承认看不清并请求新照片。若紧凑三维草图能与规划器连接,多模态大模型就不只是在图片上回答问题,还能围绕一个共享空间表示决定下一步观察或行动。部署时还应标记重建置信度,防止粗略布局被误当成精确尺寸。

参考资料

https://arxiv.org/abs/2609.38177

https://cvlab-kaist.github.io/Imagine3D-LLM

↑