arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

微软亚研院等让一张图变成长镜头世界,绕一圈回来场景仍对得上

作者:arXivDaily编辑部 arXiv 2609.03919 cs · cs.CV

论文导读

微软亚洲研究院、中国科学技术大学、清华大学等机构提出OctWorld,从一张图沿指定相机路线持续生成可探索视频。系统用动态八叉树保存三维记忆,重点处理长路径后重新看见旧区域时的空间一致性;论文展示的是离线作者实验,不能据此认定已经达到实时交互或真实世界模拟。

长镜头回到旧地方最容易露馅

从单张图片向前生成几秒视频并不难,难点出现在相机走得更远、看见更大范围后再次返回。纯自回归模型主要依赖最近几帧,早先房屋、道路和树木的位置会逐步淡出上下文;回头时,场景可能换形、重复或直接消失。

OctWorld在视频扩散模型旁加入持久三维记忆OctMap。每生成一段,系统估计深度,把颜色和几何融合进全局地图;后续镜头需要旧区域时,再从地图取回可见内容作为条件。

图:论文补充图汇集多条长路径生成序列,可观察远距离移动与区域重访。

动态八叉树把精细度留给有证据的区域

固定分辨率体素地图面临两难:网格太粗会丢掉建筑边缘和纹理,网格太细又让空白空间占满显存。OctMap使用稀疏八叉树,画面证据丰富的区域继续细分,未观察区域保持粗粒度。

地图采用截断有符号距离融合,将多帧深度合成表面。生成模型仍负责补出新视角,三维记忆负责约束已经看过的区域。两部分分工后,系统不必把整段历史视频重新塞回上下文。

图:论文OctMap示意图展示视觉观测、深度与稀疏八叉树三维表示的融合。

长路径与大视角范围上比较一致性

论文在既有基准和额外长程设置上比较先前方法,并报告OctWorld在空间一致性和视觉质量上占优。作者还把OctMap同点缓存、固定分辨率TSDF体比较,动态空间分配在细节和内存之间取得更好的平衡。

定性图更适合说明它解决的错误:同一路线中的建筑轮廓、道路方向和局部纹理在长时间后仍能接上。它们属于模型生成的视觉结果,不能当作真实地点的三维重建,也没有证明系统能实时响应游戏玩家。

图:论文对比图展示不同记忆条件下的场景重访与点云融合结果。

从可探索视频走向交互环境

OctMap提供了可扩展的外部状态,后续可加入物体持久性、动态角色和用户动作结果,让系统不仅记住静态场景,还能保存“门已打开”之类的变化。地图更新也需要判断生成错误,避免把一次畸变永久写进记忆。

产品化需要同时测延迟、显存、路线长度和回环次数。只有在多次往返、复杂室内外场景及快速镜头下仍能维持状态,持久三维记忆才适合游戏预演、内容制作或机器人模拟。

参考资料

https://arxiv.org/abs/2609.03919

https://maxtirerror.github.io/octworldpage/