论文导读
洛桑联邦理工学院、华为Bayer实验室、博洛尼亚大学联合提出Marigold V2,把现代图像生成模型改造成一次前向计算即可输出深度图的估计器。它在KITTI和ETH3D上把AbsRel误差相对此前最佳结果改善16%—26%,并能保留毛发、树叶和细边缘。数字来自指定公开基准,单张照片估深度仍不是直接测距。
单张照片最容易丢掉细边界
从一张普通照片判断每个像素离相机多远,本来就没有唯一答案。相同大小的物体可能是近处的小物体,也可能是远处的大物体。现有单目深度模型在熟悉数据上成绩不错,遇到新场景时容易把细线、毛发、植物叶片和遮挡边缘抹平,输出看上去连续,却缺少真正影响抠图、重建和机器人避障的结构。
Marigold系列的思路是复用已经学过海量图像的生成模型,把“生成一张图”改成“输出每个位置的深度”。V2选择扩散Transformer骨架,并把多步生成压成单步推理,必要时还能量化模型,避免为了更细的结果付出完整扩散采样成本。
图1:论文总览用猫毛、细线和局部放大比较多种深度估计结果,Marigold V2保留了更清楚的边缘。
两次微调分别管结构和像素
团队发现,直接让预训练生成模型学习深度会出现局部伪影:图像语义大致正确,深度边界却可能漂移。第一阶段先让模型内部信息贴近由真实深度提取的语义特征,帮助它分清物体与区域;第二阶段再用新的Sinkhorn损失细调像素级分布,压低孤立噪声并收紧边缘。
图2:论文方法图展示预训练图像模型经过语义对齐和两阶段微调后输出深度、法线等密集结果。
这种训练顺序比单纯增加模型规模更关键。第一步保证大结构不乱,第二步再处理细节;推理时则只走一次网络,不需要像常规扩散生成那样反复去噪。论文还把同一套配方用于表面法线和图像固有成分分解,说明改造目标不只限于深度。
KITTI与ETH3D误差改善16%—26%
在KITTI道路和ETH3D场景上,Marigold V2的绝对相对误差相对此前最佳方法改善16%—26%。定性图中,人物头发、动物毛发、树叶边缘和细杆结构不再大片粘连;遇到训练分布之外的图像时,深度层次也更干净。
图3:论文跨数据集对比展示输入图、其他方法和Marigold V2的深度图,局部框用于检查细边界。
AbsRel衡量预测深度与真实深度的相对差异,数值下降不代表模型能恢复不可见区域,也不等同于激光雷达的绝对测距精度。透明物体、镜面、极端光照和缺少尺度参照的场景,仍可能给单目方法制造歧义。
从清楚深度图走向稳定下游任务
更锐利的边缘可直接服务照片重光照、景深编辑、三维场景初始化和机器人视觉,但产品化要看下游结果,而不只看深度指标。下一步应测试同一模型在手机、车载相机和室内机器人上的延迟、量化损失与跨设备稳定性;还要检查细节更锐利时是否会把纹理误当成几何。只有在重建质量或操作成功率上同步获益,细发丝深度才会转化成真实应用优势。