论文导读
达姆施塔特工业大学提出ReImaGin,让多模态模型遇到空间问题时先生成一张中间图,再根据这张图回答。它可以移除遮挡、连接轨迹,或把多个房间视角整理成平面图。在多视角空间判断、碰撞预测等六项任务上,这条“先画再想”的路线超过纯文字推理和固定视觉工具,最高提升25%。
文字思维链处理不了所有视觉操作
判断两个物体会不会碰撞、几个分离视角是不是同一房间,仅靠描述坐标和关系很费劲。现有多模态模型常调用深度估计、检测或分割工具,但每个工具只有固定功能,遇到“补出遮挡部分”“把多个视角拼成地图”这样的开放操作就不够灵活。
ReImaGin把图像生成模型当作视觉推理工具。多模态模型先用自然语言说明要进行什么变换,图像模型生成中间表示,随后再根据原图与生成图回答问题。
项目页示意:模型看到房间视角后,先生成平面图形式的中间表示,再用于空间推理。
生成平面图、补遮挡、连接轨迹
在多视角房间任务中,输入是从不同位置拍摄的照片。系统要求图像生成器把桌椅、门和设备整理到同一张俯视平面图,后续模型不必在多张透视图之间反复对齐。
另一些任务要求去除遮挡物、补全被挡住的对象,或把离散点和局部轨迹连接成连续形状。固定检测工具能告诉模型“看到了什么”,生成工具则能按照自然语言构造新的、任务需要的表示。
项目页原图:多个房间视角被整理为带主要物体位置的俯视平面图。
这些生成图不是实验现场的真实测绘结果,而是模型为解题制作的中间草稿。它可能补错物体或改变几何,因此最终回答仍需评估,不能把生成内容当作事实证据。
六项任务最高提升25%
研究覆盖六类视觉推理任务,包括多视角空间关系、碰撞预测、遮挡计数和轨迹理解。ReImaGin与纯文字思维链以及调用深度估计、目标检测等专用工具的方案比较,整体保持领先,单项提升最高达到25%。
项目页结果图:不同模型与推理策略在遮挡、空间和几何任务上的对比,部分指标以误差表示,越低越好。
优势来自生成器能执行开放变换,但也受生成模型能力限制。论文展示的失败中,中间图会遗漏对象、补出错误边界或改变计数,错误随后传到答案。六项研究任务证明了方法可行,尚不能外推到任意视觉问题。
下一步,视觉推理需要可检查的中间图
图片版“思维链”的价值,在于人可以直接看到模型画了什么。下一步可把生成图交给几何检查器或第二个模型核验,发现平面图不闭合、物体数量变化时要求重画。若中间表示能保留来源视角和不确定区域,工程系统就能区分“输入中确实存在”与“生成器为解题推测”的内容。