ChronoWorld:基于时空线索与几何反思的相机可控一致4D世界生成
ChronoWorld: Camera-Controlled Consistent 4D World Generation via Spatiotemporal Cues and Geometric Reflections
浏览论文内容
中文总结 AI 辅助
针对相机可控视频生成中4D时空一致性的挑战,提出ChronoWorld框架,通过时空因果注意力与几何反思机制,实现全局一致、自由视角的4D场景生成,达到最先进性能。
中文摘要 AI 辅助
虽然现有的相机可控视频生成模型能够产生视觉上引人注目的序列,但保持内在的4D时空一致性仍然具有挑战性。为解决这一局限,我们提出了ChronoWorld,一个“观察-状态-反思”框架,利用时空因果线索和重建先验来生成全局一致、自由视角的4D场景。给定一个上下文视频,我们引入了一种时空对极因果注意力机制,在生成过程中强制执行多视角对极约束和时间因果性。此外,我们开发了一条由重建驱动的几何反思流水线,并配以4D检索策略,以实现对生成输出的动态自我评估和修正,从而提高一致性和准确性。大量实验表明,ChronoWorld在时空一致、电影级质量的4D场景生成方面达到了最先进的性能,并在多样场景中展现出强大的泛化能力和高保真几何。
英文摘要
While existing camera-controllable video generation models can produce visually compelling sequences, preserving intrinsic 4D spatiotemporal coherence remains challenging. To address this limitation, we propose ChronoWorld, an "Observation--State--Reflection" framework that leverages spatiotemporal causal cues and reconstruction priors to generate globally consistent, free-view 4D scenes. Given a context video, we introduce a Spatiotemporal Epipolar Causal Attention mechanism that enforces multi-view epipolar constraints and temporal causality throughout the generation process. In addition, we develop a reconstruction-driven geometric reflection pipeline with a 4D retrieval strategy to enable dynamic self-assessment and correction of generated outputs, improving consistency and accuracy. Extensive experiments show that ChronoWorld achieves state-of-the-art performance in spatiotemporally consistent, cinematic-quality 4D scene generation, with strong generalization and high-fidelity geometry across diverse scenarios.
发表机构
- Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)
- University of California, Merced(加州大学默塞德分校)
机构由 AI 辅助整理,请以论文原文为准。