Meta Reality Labs、苏黎世联邦理工和波恩大学提出Map-Det3D,只读取连续RGB画面,就能在线重建带米制尺度的三维空间,并直接预测物体3D框。它不依赖深度相机,也不沿用“先在2D图像检测,再为每个框猜深度”的常见流水线。
机器人和AR设备要知道物体在左边还是右边,也要知道距离多少米、占据多大空间。单张RGB图缺少绝对尺度,相似大小的物体可能近而小,也可能远而大;一个不大的距离误差就会让三维框整体漂移。
短时间窗把单目视频变成多视角输入
Map-Det3D读取一个短时间窗口,把摄像头移动产生的连续画面组织成多视角。不同视点共同约束几何,缓解单帧深度和尺度不确定。系统面向流式输入,每到一帧更新一次空间表示,不要求先收集完整视频后离线建图。
Map-Det3D在重建空间中进行在线三维检测。
这种设定适合头戴设备、移动机器人和手持相机:设备本身在运动,连续帧天然提供视差。论文讨论的“只靠RGB”并不等于只用一张照片,它依赖短时多视角和相机运动形成的额外几何线索。
短时间窗也控制了在线成本。窗口太短,几何约束不足;无限累积历史,又会增加显存并把早期位姿误差带入当前检测。Map-Det3D只融合最近的多视角信息,让重建与检测随着视频前进持续更新。
检测头直接工作在米制三维空间
常见单目3D检测先在图像上找2D物体,再回归深度、尺寸和方向。每个物体独立猜尺度,换相机、换场景或换运动模式后容易失效。Map-Det3D复用前馈米制三维重建模型作为几何骨干,并针对物体感知进行调优。
多视角编码器、尺度Token与三维检测头。
来自多个视角的特征进入共享权重编码器,尺度Token提供米制信息,多视角Transformer融合空间证据。检测头在已经重建的3D空间内直接查询并输出框,不再执行独立的2D到3D提升。场景几何和物体位置因此使用同一坐标系。
连续帧让三维框随视角逐步稳定
论文在多个基准上报告了较强的在线检测表现,并强调无需适配的跨域迁移。重建先验不只记住训练集里“椅子通常多大”,还利用多视角关系推断实际场景尺度,换环境时比单纯类别尺度先验更稳。
连续RGB输入下三维场景与目标框的更新过程。
系统仍会受到快速运动、纹理稀少、强反光和严重遮挡影响。短时间窗如果缺少足够视差,绝对尺度依旧难确定。论文结果基于列出的室内与三维检测基准,不能直接等同自动驾驶或室外机器人已经达到相同可靠性。
Map-Det3D在真实室内场景中的三维检测结果。
下一步进入低成本机器人与空间计算设备
减少深度传感器可以降低设备成本、功耗和集成复杂度。移动机器人可用普通相机建立可操作空间,AR眼镜也能在连续观察中估计桌椅和物品位置,再把虚拟内容放到正确尺度与深度。
团队已公开代码和模型。走向实时设备还需测量端侧算力、摄像头标定误差与长时间漂移,并为安全动作加入置信度和回退机制。Map-Det3D已经展示一条清晰路线:先从视频恢复统一米制空间,再在空间里完成检测。
部署评测应同时报告距离误差、框尺寸、处理帧率和跨相机迁移,而不能只看单一检测分数。机器人抓取更关心近处小物体的厘米级偏差,空间计算则要保证虚拟内容在相机移动后不漂移;同一三维骨干可以针对这些任务分别调优。
普通RGB相机还能复用设备已有摄像头,不必为深度模块重新设计外壳和供电。低成本不自动等于高可靠,系统仍需在光照突变、运动模糊和镜面物体上给出置信度。若连续几帧的重建尺度不一致,应用应暂停危险动作并等待更多视角,而非输出一个看似确定的三维框。
这些机制也适用于室内导航和物品盘点。