arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

英伟达只加约1%参数改造3D重建,单卡8小时收敛、轨迹误差降逾60%

作者:arXivDaily编辑部 arXiv 2609.04201 cs · cs.CV

论文导读

英伟达、阳明交通大学提出Scal3R,专门修复长视频在线三维重建的累计位姿漂移。它冻结原有主干,只增加约1%可学习参数,单张GPU训练8小时,并把KITTI相对在线基线的平均轨迹误差降低超过60%;这个比例只对应论文比较设置。

深度还稳定,全球位姿却先崩了

在线三维重建模型通常把每一帧的位置都相对第一帧预测。视频很长后,新画面与起点差异越来越大,模型被迫做训练分布之外的远距离外推;微小位姿误差不断累积,最终把道路拉长、点云折叠或闭环拆开。

团队观察到一个反差:全局轨迹已经明显崩坏时,逐帧深度仍然稳定。局部几何主干没有失效,主要问题集中在位姿头。Scal3R因此冻结原主干,只改造位置查询与后端优化。

图:论文图1对比固定首帧锚点导致的漂移与Scal3R多参考位姿查询。

每个新帧同时询问多个历史关键帧

Scal3R加入轻量可学习查询Token,占总参数约1%。新帧到来时,它不再只问“我相对第一帧在哪里”,而是同时参考多个近期或重访关键帧,先获得一组局部相对位姿。

不对称注意力让这些查询读取冻结主干的几何线索,却不改变原图像Token之间的自注意力。在线位姿图优化再把局部约束拼成全局轨迹,并通过回环检测拉回长期漂移。

图:论文图3展示冻结编码器、多参考位姿Token和在线位姿图优化的连接。

单卡8小时训练,KITTI误差降逾60%

论文报告Scal3R在单张GPU上约8小时收敛。相对所用在线基线,它在KITTI上的平均绝对轨迹误差降低超过60%,并在Virtual KITTI、Sintel、TUM-Dynamic、ScanNet和7-Scenes上取得作者报告的领先结果。

KITTI长序列的轨迹图显示,多种基线出现大范围漂移,Scal3R更完整地恢复闭环。60%只描述特定基线与平均ATE,不能解释成所有数据集、所有主干的误差都下降同一比例。

图:论文图7比较KITTI长序列上的估计轨迹,Scal3R保留更完整的闭环结构。

图:论文图6展示两段Virtual KITTI序列的点云与轨迹差异。

下一步让轻量位姿层接到更多重建主干

Scal3R已经在CUT3R与STream3R类主干上验证,后续可测试更长城市路线、快速转弯与大量动态物体。查询关键帧的选择也可结合场景变化,避免在重复纹理或人群遮挡中建立错误闭环。

部署到机器人或AR设备还要控制在线优化延迟。论文把大部分模型冻结,降低了训练成本;运行端仍需保存关键帧、搜索回环并维护位姿图,真实硬件上的内存和功耗是下一组指标。工程测试还应记录每公里累计误差、闭环检索耗时和错误闭环率,并分别检查室内窄空间、夜间道路和重复纹理走廊,避免平均ATE掩盖局部几何崩塌。

参考资料

https://arxiv.org/abs/2609.04201

https://linjohnss.github.io/scal3r/