arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

DeepMind一套模型吃遍普通、鱼眼和360度相机

作者:arXivDaily编辑部 arXiv 2609.09394 cs · cs.CV

论文导读

Google DeepMind、苏黎世联邦理工学院联合提出OmniPoint,用一套权重处理普通透视、鱼眼和360度全景图,从单张图片恢复带真实尺度的三维点云。方法在多个基准上做零样本评测,还能接收相机内参或稀疏深度;这些成绩不等于所有镜头、光照和场景都能稳定重建。

换一种镜头,传统单目深度模型就容易失真

普通相机把直线投到近似平面上,鱼眼镜头会把视野压成强烈弯曲的圆形,360度全景图又采用另一套展开方式。许多单目三维模型默认一种固定投影,训练时看到的是普通照片,遇到鱼眼道路或全景室内图,墙面和地面就可能弯掉。为每类相机各训练一套模型,又会增加数据和部署成本。

OmniPoint把输出改成“射线方向加沿射线距离”。射线描述每个像素从相机向哪里看,距离描述物体在这条射线上有多远。相机如何投影与场景本身长什么样被拆开后,同一个网络就不必把某种镜头的平面深度规律写死。

图1:同一套OmniPoint权重处理普通、鱼眼和360度全景输入,并输出公制点云。

内参和稀疏深度有就用,没有也能运行

网络以DINOv2视觉编码器读取图像,再分别预测射线、距离、天空区域和整体尺度。如果设备提供相机内参,或只有少量深度测量,系统会把这些信息作为额外条件加入;没有这些条件时,仍可只用一张RGB图工作。为避免少量测量点让特征突然失衡,论文用可学习的输入状态和高斯平滑把稀疏信号更稳定地注入网络。

图2:图像与可选内参、稀疏深度进入统一编码器,再输出射线、距离、天空掩码和尺度。

训练数据同样要跨过镜头差异。团队把有标注的透视图转换成鱼眼和全景视角,也从没有深度标注的宽视野图像中重新投影出虚拟普通视角做自训练。两条方向一起用,让模型既保留普通相机数据的三维监督,也能接触真实的非透视画面。

全景墙面和鱼眼道路不再被投影方式带弯

论文在多类相机基准上做零样本测试,也比较了只擅长特定相机的模型。定性结果中,OmniPoint在全景图里保持墙面竖直,在鱼眼道路上减少不合理弯曲,并恢复更细的深度与点云结构。它还可以接受不完整内参和稀疏深度,逐步改善已有重建,而不必切换到另一套模型。

图3:全景、鱼眼和普通相机上,OmniPoint与基线的深度和点云定性对比。

“公制”表示输出尝试恢复现实尺度,不只是远近顺序。单张图仍存在遮挡和尺度歧义,透明、反光物体或极端畸变也可能破坏估计。项目结果来自公开基准与展示样例,不能直接替代测量级三维扫描。

未来可把一套几何模型部署到更多相机设备

统一相机模型对机器人、全景内容、车载鱼眼和移动设备都更省事:设备换镜头后,开发者可以先复用同一套网络,再按传感器提供的内参或少量深度补充条件。后续若加入视频连续性、更广的真实镜头数据和不确定性估计,系统才更适合在导航、测绘和空间计算中长期运行。当前最直接的价值,是把原本分散的单目重建入口合并到一个可扩展框架里。

参考资料

https://arxiv.org/abs/2609.09394

https://arxiv.org/html/2609.09394

https://botaoye.github.io/omnipoint/