arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频生成模型还会看懂三维?把图像与深度当成连续帧

作者:arXivDaily编辑部 arXiv 2608.28549 cs · cs.AI · cs.CV

输入一张普通RGB照片,模型同时输出单目深度和表面法线。萨里大学、帝国理工学院等机构提出GeoNeXt,把预训练视频生成模型改造成统一几何学习器:原图是第一帧,深度与法线成为后续“几何帧”,三者沿同一去噪过程生成。

研究在多个零样本数据集上比较深度与法线估计,报告结果超过多种专用或统一生成式方法,并使用更少的任务配对数据。评测集中在单目深度和法线基准,不能据此宣称模型已经完成完整三维场景理解或可直接替代测距传感器。

深度和法线原本常由两个模型处理

单目深度估计为每个像素预测远近,表面法线描述局部表面的朝向。两者都来自场景几何,却常被拆成独立任务:一套网络学深度,另一套网络学法线。分别训练会重复使用大量图像,也难以保证同一物体的深度边界与法线变化互相一致。

已有扩散方法把几何图当成一种特殊图片,通过图像条件生成深度或法线。若为每个任务改造一套架构,统一模型的优势会减弱;若添加复杂交叉注意力或切换模块,训练数据和参数成本又会上升。

图1:输入RGB图像后,GeoNeXt联合生成彩色法线图与单目深度图。

把几何目标排进视频时间轴

GeoNeXt沿用Stable Video Diffusion的帧序列思路,把输入图像复制到几何槽位作为条件,再让去噪网络按固定顺序生成图像、深度和法线。模型学习的不是物体真实运动,而是不同视觉模态之间的连续关系。

训练时微调视频扩散模型的去噪U-Net,移除不需要的文本与CLIP分支,并保持主要生成顺序。配对数据来自Hypersim、Virtual KITTI等含RGB、深度和法线的场景。论文没有采用“冻结整个主干只训练轻量预测头”的方案;收益来自视频生成先验与针对几何任务的联合微调。

图2:RGB、深度和法线被组织为连续槽位,去噪网络学习图像与几何的联合分布。

深度边界在跨数据集测试中保持清楚

零样本深度评测要求模型在未参与训练的数据集上预测相对深度,再按统一协议对齐尺度和偏移。定性图中,GeoNeXt对车辆、室内家具和人物轮廓的边界较完整,细杆和遮挡处仍会出现平滑或断裂。

图3:多个数据集上的单目深度定性对比,颜色表示相对远近。

论文表格将GeoNeXt与Marigold、Depth Anything系列及其他生成式几何模型比较。不同方法的训练数据规模、骨干和后处理并不完全一致,因此单项领先只能解释为指定协议下的结果。单目深度本身也缺少绝对尺度,没有相机内参或额外约束时,不能直接输出可靠米制距离。

下一步:用统一几何输出服务下游任务

表面法线对局部形状更敏感:墙面应保持平整,曲面和物体边缘要快速改变方向。GeoNeXt联合生成两类几何后,深度提供全局层次,法线约束局部朝向。定性结果中,室内平面、车辆和人体轮廓的方向变化更连贯。

图4:表面法线估计对比,颜色编码三维方向,边界处反映局部几何变化。

下一步可以把相机内参、视频多帧或稀疏真实深度加入条件,检验统一生成框架能否从相对几何走向可测量三维。对机器人、重建和内容生成系统,较实际的接入方式是先把GeoNeXt作为几何先验,再由多视图一致性、传感器数据或优化模块校正,而不是直接把单张图结果当作真实世界尺寸。

实际系统还应暴露失败区域,而不是只给一张看似平滑的彩色结果。透明物体、镜面、细杆和天空往往缺少稳定几何线索,若模型能输出不确定性,下游重建或机器人规划就可以选择重拍、降权或切换专用传感器。

参考资料

https://arxiv.org/abs/2608.28549

https://arxiv.org/html/2608.28549

https://happy-hsy.github.io/projects/GeoNeXt/

https://arxiv.org/pdf/2608.28549