arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

低分辨率深度传感器也能生成密集3D:合成训练跨过3款真实设备

arXiv 2608.04737 cs.CV · cs.GR

韩国科学技术院、中国科学技术大学和微软亚洲研究院提出一种稀疏dToF深度补全模型。它只用合成数据训练,却在六个数据集和三款真实直接飞行时间传感器上做零样本测试,把低分辨率、带噪的测距点补成密集度量深度图。

dToF通过测量光往返时间直接得到距离,精度高,也比部分间接测距方案更能应对复杂环境。但高成本和有限光电二极管数量使输出非常稀疏,机器人、XR和三维感知仍需要结合RGB图像补全空白区域。

RGB与稀疏深度双分支补全流程

论文图2:RGB图像与稀疏dToF数据分别编码,融合后由轻量解码器恢复密集度量深度。

深度数据不能在融合时被图像盖掉

单目深度模型能从纹理猜远近,但输出常缺少可靠绝对尺度。稀疏dToF点提供真实米制距离,却数量少、分布不规则。普通融合网络如果把两者直接混合,密集RGB特征可能覆盖本来更可靠的深度信号。

团队采用双分支视觉Transformer,让图像Token与深度Token分别处理。联合注意力加入方向掩码:深度信息可以指导图像特征,图像分支却不能反向改写深度Token,随后再把两路信息送入轻量解码器。

图像与深度Token的双分支融合层

论文图3:图像分支持续提取外观,深度分支保留传感器测量,两者在专门的融合层交换信息。

定向掩码限制跨模态信息流

论文图4:掩码允许深度Token引导图像Token,同时阻止RGB噪声覆盖原始深度测量。

一套仿真管线制造三类传感器缺陷

真实RGB与dToF配对数据很少,设备之间的采样图案又不同。团队模拟极稀疏闪光dToF、亚VGA闪光阵列和旋转式激光雷达,并加入空间偏移、精度下降、空洞和不同噪声分布。

三类dToF传感器采样模式

论文图5:仿真覆盖随机稀疏点、低分辨率阵列投影和旋转线束三种代表性采样方式。

模型没有使用扩散生成或多轮细化后处理。论文在精度—推理时间对比中报告更低误差和较快速度,并在真实与仿真稀疏输入、不同噪声模式下与多种深度补全方法比较。

零样本泛化仍受仿真假设约束

“只用合成数据”减少了为每款传感器重新采集训练集的需求,也把风险集中到模拟器:未建模的多径反射、强阳光、透明或高反物体、设备校准误差,都可能让真实输入偏离训练分布。

六个数据集和三款设备说明模型跨过了多种采样条件,尚不能代表所有dToF硬件和部署环境。用于机器人避障或医疗三维感知时,还需要按具体设备评估绝对误差、失败区域和实时延迟,不能只依赖论文的平均指标。

参考资料

https://arxiv.org/abs/2608.04737

https://vclab.kaist.ac.kr/cvpr2026p3