论文导读
香港科技大学、腾讯与香港大学等机构联合推出几何原生自编码器GAE,攻克了世界模型在长程三维漫游中容易变形穿模的结构缺陷。研究团队将几何基础模型的多层级表征融入视频潜在空间,从底层赋予生成模型强三维几何先验。在权威真实室内与室外漫游评测中,GAE不仅将视频生成质量FVD指标提升高达23.1%,更将多视角三维重投影几何误差直接减半。
外观陷阱:世界模型为何一漫游就穿模变形
世界模型被视为具身智能理解物理世界与虚拟现实场景生成的核心引擎。近年来基于扩散模型的视频生成取得了长足进步,但当虚拟相机在场景中大尺度移动时,现有模型普遍暴露出严重的空间不一致问题。原本笔直的墙角在转头后发生弯曲,桌椅相对距离随意漂移,甚至出现物体凭空增减等穿模假象。
这一缺陷根源在于传统的潜在表示设计。目前主流模型依赖基于RGB像素重建的外观原生自动编码器,网络内部仅追求单帧画面的像素保真度,对三维几何结构毫无概念。当相机轨迹稍微拉长,缺乏空间约束的外观潜在向量便迅速漂移,导致多帧画面的空间立体结构彻底崩塌。
图:给定参考单图与相机运动轨迹生成对应RGB画面、几何深度与三维点云
几何原生潜在空间:多层级基础特征端到端压缩
为了让世界模型真正具备三维物理直觉,联合团队提出了几何原生自编码架构GAE。该方案的核心思路不再局限于像素外观,而是将几何基础模型所提炼的致密三维特征作为首要驱动力。
在具体实施中,系统分两阶段有序推进:第一阶段构建几何编解码器,将预训练几何模型提取的多层级高维空间特征深度融合,并压缩进标准尺寸的潜在表示空间;第二阶段则在该几何潜在空间上直接训练扩散生成网络。通过将真实几何深度与视角约束硬编码进潜空间,生成模型在采样推演时天生受到空间拓扑的强力约束。
图:展示阶段一几何特征编码压缩与阶段二基于潜在扩散的三维一致生成机制
权威基准评测:长程重投影误差腰斩,FVD提升23.1%
在包含海量真实相机轨迹的RealEstate10K与DL3DV基准测试中,GAE展现出卓越的三维几何一致性与画面表现力。
在定性检验中,研究团队将不同模型生成的连续多视角画面重新反投影为三维点云。传统外观模型与语义潜在模型生成的点云呈现出明显的重影与断层,而GAE重构出的三维场景轮廓分明、几何表面严丝合缝。在定量指标上,GAE生成的视频在FVD指标上相比基线实现最高23.1%的显著优化,跨视角几何重投影漂移误差更直接减少了一半,彻底消除了镜头移动中的变形眩晕感。
图:外观原生VAE、语义潜在空间与几何原生GAE在三维重投影下的点云一致性对比
图:在室内大场景下多视角连续生成帧的RGB色彩、几何深度图与相机位姿拟合结果
影视漫游与机器人仿真应用:空间世界模型落地探索
GAE的成功表明,赋予生成模型几何原生感知是通往高保真物理世界模型的必由之路。无论在极端相机位姿变换还是超长视距漫游下,稳定的几何先验都能够有效保障场景的拓扑恒定。
研究团队表示,未来将继续把该几何潜在空间扩展至动态可交互物体模拟,为具身智能端到端闭环训练以及全自动3D虚拟现实漫游提供更加坚实的空间世界基石。