arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

SpatialGuard:基于布局管控的可验证空间推理文本到图像生成方法

SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation

Ziyun Qian, Zizhi Chen, Yizhou Liu, Mingyang Sun, Dingkang Yang, Lihua Zhang

arXiv 2609.01582首次发表:更新:

发表机构

College of Intelligent Robotics and Advanced Manufacturing, Fudan University; Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(复旦大学智能机器人与先进制造学院; Fysics智能科技有限公司(Fysics AI))

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

SpatialGuard是一种结构化布局引导框架,通过布局管控器实现可验证的空间推理,提升了复杂3D空间文本到图像生成的空间保真度,达到当前最优性能。

AI 中文摘要

复杂3D空间文本到图像生成要求模型将自然语言转换为稳定的视觉几何,而非仅语义外观。现有提示驱动或布局条件方法提升了可控性,但在视觉采样前常缺乏可优化且可验证的空间中介,导致多轮生成中对象关系、遮挡、可见性及相机约束易衰减。本文提出SpatialGuard,一种面向复杂3D空间文本到图像生成的结构化布局引导框架:其通过空间布局架构(Spatial Layout Architect)将提示解析为面向图像合成的3D布局,经视觉实现器(Visual Realizer)将其转化为视觉条件与候选图像,再通过视觉对齐评判器(Visual Alignment Critic)验证提示、布局与图像间的一致性。为使约束在迭代中保持稳定,SpatialGuard引入布局管控器(Layout Harness),围绕可编辑布局状态组织规则约束、工具调用、共享知识与反馈循环。该设计将复杂空间生成从隐式提示遵循转变为规划、实现、验证与修复的可验证流程。综合实验表明,SpatialGuard在复杂3D空间布局生成中达到了当前最优性能,且相比现有文本到图像及布局控制基线方法,空间保真度得到提升。

英文摘要

Complex 3D spatial text to image generation requires models to convert natural language into stable visual geometry, not merely semantic appearance. Existing prompt-driven or layout-conditioned methods improve controllability, but often lack an optimizable and verifiable spatial intermediary before visual sampling. As a result, object relations, occlusion, visibility, and camera constraints can decay during multi-round generation. This paper presents SpatialGuard, a structured layout-guided framework for complex 3D spatial text-to-image generation. SpatialGuard parses prompts into image synthesis-oriented 3D layouts through a Spatial Layout Architect, realizes them as visual conditions and candidate images through a Visual Realizer, and uses a Visual Alignment Critic to validate consistency among prompt, layout, and image. To keep constraints stable across iterations, SpatialGuard introduces a Layout Harness that organizes rule constraints, tool invocation, shared knowledge, and feedback loops around the editable layout state. This design turns complex spatial generation from implicit prompt following into a verifiable process of planning, realization, validation, and repair. Comprehensive experiments show that SpatialGuard achieves state-of-the-art performance in complex 3D spatial layout generation and improves spatial faithfulness over existing text-to-image and layout control baselines.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑