长视频做三维重建,最直接的办法是让模型不断回看过去所有画面,代价是内存和计算随视频长度增长。阿里巴巴高德视觉团队提出ABot-Recon,只固定保留第一帧和最近10帧,就能连续估计相机轨迹、深度与场景点云。
在Oxford Spires长序列上,论文报告其绝对轨迹误差和相对位姿误差较此前最佳方法约降低40%。模型仍通过逐段位姿组合形成全局轨迹,序列越长,局部误差仍可能累积;“11帧”解决的是固定上下文和局部稳定性,不是彻底消除漂移。
全历史上下文并不总是更可靠
许多重建模型以一组图像为输入,同时预测相机与几何。把它们直接改成流式系统后,新帧会不断加入上下文。窗口太短,模型容易忘记场景起点;窗口持续增大,较早画面与当前视角差异很大,注意力还要在大量重复或弱相关信息中寻找对应关系。
ABot-Recon采用“锚点加局部窗口”:第一帧固定作为全局参照,最近10帧提供当前运动和局部几何。缓存始终是11帧,不随视频长度增加。新一批画面到来后,模型输出相机、深度和点云,再把结果接到已有轨迹上。
图1:ABot-Recon固定保留首帧与最近10帧,以恒定大小上下文处理长视频。
三个模块分开处理相机、几何和细节
系统先用视觉骨干提取多帧特征,局部相机模块估计相邻窗口的位姿关系,几何分支恢复深度与点云。首帧提供跨窗口坐标锚点,避免每个窗口都建立互不相干的局部世界。
研究团队还加入轻量细化器,利用最近窗口的高分辨率信息修正几何边界。它不需要把完整视频重新送进网络,因此能在序列继续增长时维持固定显存。模型输出仍是逐步更新的重建结果,适合边拍边处理,而非等视频结束后一次性优化。
图2:长序列场景的相机轨迹与三维结构重建示例。
间隔变大时,局部窗口仍保持稳定
团队在KITTI等序列上改变输入帧间隔,测试车辆移动更快、相邻画面重叠更少时的相对位姿误差。图中不同时间间隔下,ABot-Recon的旋转和平移误差保持较低,说明固定窗口并非只对缓慢、连续移动有效。
图3:输入帧间隔变化时,多种方法的相对旋转与平移误差对比。
论文在Oxford Spires上给出的两项关键指标,较此前最佳结果的相对降幅接近40%。这是一套具体数据、分辨率和相机运动条件下的比较。室内快速转身、大片无纹理墙面、强反光或循环路线,仍可能让局部对应失效。
下一步:把长视频重建带到真实采集链路
运行误差随帧数变化的曲线显示,部分方法在序列拉长后漂移迅速扩大;ABot-Recon增长更慢。固定缓存还让推理内存不随历史帧数线性增加,移动机器人或穿戴设备可以持续处理相机流,不必周期性清空全部状态。
图4:KITTI长序列中,运行轨迹误差随处理帧数增加的变化。
下一步可以把局部重建与回环检测、全局图优化结合:前者负责实时更新,后者在机器人重回旧地点时校正累计漂移。进入产品部署还要测量实际帧率、峰值显存、断流恢复和跨设备相机标定误差,才能判断11帧上下文是否适合导航、空间扫描或AR眼镜的实时管线。
真实部署还要处理丢帧、曝光突变、相机内参漂移和回环重访。只看平均位姿误差,无法说明地图是否出现局部撕裂或尺度跳变;更完整的评测应同时给出闭环一致性、重建完整率和每分钟视频的处理成本。这样才能判断“只记11帧”究竟节省了多少显存,又是否把历史信息损失转移成后续修图工作。
公开逐序列结果,也能避免平均值掩盖少数严重漂移案例。
参考资料
https://arxiv.org/abs/2608.27529
https://arxiv.org/html/2608.27529