arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

AI看懂3D却量不准?浙大实测100个场景查距离误差

作者:arXivDaily编辑部 arXiv 2610.12423 cs · cs.CV

论文导读

浙江大学、浙江工业大学、上海交通大学联合提出Pumpire,用100个真实室内场景检查AI重建的几何精度。数据包括6400帧和人工核验的三维点,测试29种模型配置。研究发现,画面看着合理仍可能距离不准,替换成真实相机参数也不保证误差变小。

窗户和细杆,距离先出问题

Pumpire记录了室内场景中容易干扰测距的对象:透明窗户、反光表面、细长结构和物体边缘。论文把真实画面与深度传感器结果放在一起,能看到这些位置附近的深度缺失或异常。

一些AI模型能让这些画面看起来更完整,但补出来的几何不一定量得准。研究把视觉上的合理和实际距离分开检查,要求模型预测的点能与人工核验的三维位置对应。

测试覆盖单张图估计深度、补全稀疏深度、多帧重建和多帧补全四类任务。用同一套场景检查不同输入方式,能看出更多帧或更多测距点究竟在哪些条件下有帮助。

图:透明、反光、细长结构和边缘的实景画面,下方对应传感器深度异常或缺失。

100个场景,位置也要人工复核

数据包含100个场景,每个64帧,共6400帧。采集时同时保留图像、深度和相机信息,再选择可定位的点、跟踪它们跨帧的位置,并人工检查匹配和三维标注。

基准按传感器重复测量的相对波动划分场景,其中76个为常规场景、24个为挑战场景。划分依据来自测量稳定性,而不是挑选某个模型表现差的图片。

人工核验点提供了独立参照,可以检查窗面、边缘等传感器本身容易出错的位置。论文还展示了标注工具和点跟踪流程,让数据如何形成、检查了什么有明确的记录。

图:数据采集后进行点选择、跨帧跟踪和人工核验,右侧展示标注界面。

换成真实参数,47项反而更差

团队评估29种模型配置:八种单图深度估计、十种单图补全、六种多帧估计和五种多帧补全。不同任务分别统计绝对距离误差和阈值准确指标,结果不应合并成一个通用排行榜。

原始传感器在常规场景中的平均绝对误差为0.026米,在挑战场景中为4.047米。前者的1.05倍误差阈值内比例为79.32%,后者在两倍阈值内仅1.03%。阈值不同,两个百分比不能直接作同口径对比。

另一个实验把模型估计的相机内参替换成真实参数,56组模型与指标配对中有47组变差。这说明模型给出的深度和相机参数可能已经互相配合,单独替换其中一个并不一定修正整体几何。更多稀疏测距点也并非在全部测试中稳定改善结果。

应用前景:看起来像房间,还要量得像房间

论文的多视角补全图逐步增加带深度测量的视角比例,MapAnything的距离估计从96.72厘米接近到77.86厘米,参照距离为75.60厘米。这组案例显示加入深度输入可以纠正尺寸,整体实验则说明收益需要按模型和输入条件分别验证。

面向室内测量或机器人使用时,可以沿着这套基准同时检查普通场景和玻璃、反光等挑战区域。论文已有独立的点位参照与多输入任务设置,后续模型可以据此比较精度、稳定性和新增输入的实际收益。

图:左侧为场景参照和传感器结果,右侧逐步增加带深度输入的视角,距离估计逐渐接近参照值。

参考资料

https://arxiv.org/abs/2610.12423

https://pumpire.github.io/

↑