arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频一转镜头就变形?腾讯把3D几何塞进生成底层

作者:arXivDaily编辑部 arXiv 2609.24981 cs · cs.CV

论文导读

香港科技大学、腾讯、香港大学、得克萨斯大学奥斯汀分校提出GAE,把3D几何直接放进生成模型的潜空间。同一份紧凑表示可解码画面、深度、相机和点云;在两个视频数据集上,FVD分别下降12.7%和23.1%。

画面很真,不代表同一房间始终存在

视频生成器通常压缩颜色、纹理和语义,再在潜空间里去噪。单帧看起来可以很逼真,但镜头移动后,门窗比例、家具位置和遮挡关系可能悄悄改变。额外预测深度只能增加一个输出,未必让生成过程本身按同一套空间结构演化。

GAE从几何基础模型的特征出发,重新压成适合生成的潜变量。这个变量既能还原RGB外观,也能读出深度、相机射线和点图。生成器每一步更新的对象因此不再只有“像什么”,还包含“各部分在三维空间如何对应”。

图:室内外场景同时展示RGB、深度、多视角和点云结果,中央为GAE几何潜空间。

只换潜空间,固定生成器做对照

为了判断提升来自表示还是更大的模型,团队在控制实验中固定生成器架构和训练协议,只替换潜空间。RealEstate10K上的FVD下降12.7%,DL3DV下降23.1%;在RealEstate10K中,相机轨迹误差减半。FVD反映生成分布与真实视频的差距,轨迹误差则从另一个方向检查镜头运动是否自洽。

论文还从潜变量邻域、跨视角一致性和空间相对关系等角度诊断表示。像素编解码器擅长还原外观,但未必自然保留几何;几何基础模型的原始高维特征又不适合直接拿来做扩散。GAE的工作是把两者压到一个可生成、也可读出几何的接口。

图:多种潜空间在相同条件下生成的场景、深度和视角一致性结果并列展示。

一份潜变量连接感知与生成

同一潜空间能接受参考图、相机轨迹和文本条件,也能输出画面与几何。对图生视频,参考帧提供外观;相机射线告诉模型视角怎么移动;跨视角结构则由几何潜变量维持。论文的81视角长序列还展示了多帧画面与同源点云。

定性案例包含卧室、街景和合成物体,颜色图与深度图成对出现。它们说明模型确实能从相同潜变量读出两类信息,但这些展示不能替代真实复杂场景中的长期稳定测试。

图:多组文本生成画面与对应深度结果成对排列,显示外观和几何由同一潜空间解码。

从视频生成走向可交互三维世界

如果生成状态能稳定提供相机和点云,它可以成为视频、空间重建和世界模型之间的共享接口。下一步要检验动态物体、长时间遮挡和更自由相机路径,因为几何一致的静态房间并不自动等于物理一致的可交互世界。GAE目前提供的是一个经过控制实验验证的表示底座。

参考资料

https://arxiv.org/abs/2609.24981

https://arxiv.org/pdf/2609.24981

https://jiah-cloud.github.io/GAE.github.io/

https://github.com/TencentARC/GAE-GeometricAutoEncoder