论文导读
香港科技大学、腾讯、香港大学、得克萨斯大学奥斯汀分校提出GAE,把3D几何直接放进生成模型的潜空间。同一份紧凑表示可解码画面、深度、相机和点云;在两个视频数据集上,FVD分别下降12.7%和23.1%。
画面很真,不代表同一房间始终存在
视频生成器通常压缩颜色、纹理和语义,再在潜空间里去噪。单帧看起来可以很逼真,但镜头移动后,门窗比例、家具位置和遮挡关系可能悄悄改变。额外预测深度只能增加一个输出,未必让生成过程本身按同一套空间结构演化。
GAE从几何基础模型的特征出发,重新压成适合生成的潜变量。这个变量既能还原RGB外观,也能读出深度、相机射线和点图。生成器每一步更新的对象因此不再只有“像什么”,还包含“各部分在三维空间如何对应”。
图:室内外场景同时展示RGB、深度、多视角和点云结果,中央为GAE几何潜空间。
只换潜空间,固定生成器做对照
为了判断提升来自表示还是更大的模型,团队在控制实验中固定生成器架构和训练协议,只替换潜空间。RealEstate10K上的FVD下降12.7%,DL3DV下降23.1%;在RealEstate10K中,相机轨迹误差减半。FVD反映生成分布与真实视频的差距,轨迹误差则从另一个方向检查镜头运动是否自洽。
论文还从潜变量邻域、跨视角一致性和空间相对关系等角度诊断表示。像素编解码器擅长还原外观,但未必自然保留几何;几何基础模型的原始高维特征又不适合直接拿来做扩散。GAE的工作是把两者压到一个可生成、也可读出几何的接口。
图:多种潜空间在相同条件下生成的场景、深度和视角一致性结果并列展示。
一份潜变量连接感知与生成
同一潜空间能接受参考图、相机轨迹和文本条件,也能输出画面与几何。对图生视频,参考帧提供外观;相机射线告诉模型视角怎么移动;跨视角结构则由几何潜变量维持。论文的81视角长序列还展示了多帧画面与同源点云。
定性案例包含卧室、街景和合成物体,颜色图与深度图成对出现。它们说明模型确实能从相同潜变量读出两类信息,但这些展示不能替代真实复杂场景中的长期稳定测试。
图:多组文本生成画面与对应深度结果成对排列,显示外观和几何由同一潜空间解码。
从视频生成走向可交互三维世界
如果生成状态能稳定提供相机和点云,它可以成为视频、空间重建和世界模型之间的共享接口。下一步要检验动态物体、长时间遮挡和更自由相机路径,因为几何一致的静态房间并不自动等于物理一致的可交互世界。GAE目前提供的是一个经过控制实验验证的表示底座。
参考资料
https://arxiv.org/abs/2609.24981
https://arxiv.org/pdf/2609.24981