水下单目视频不仅缺少尺度信息,还会被光线衰减、散射和颜色偏移干扰。浙江大学、上海人工智能实验室、上海交通大学、清华大学等机构提出AquaFlow,让系统一边接收视频,一边估计相机轨迹并更新3D高斯场景。62条水下轨迹上,平均定位误差比WaterSplat-SLAM降低13.2%,PSNR提高4.74 dB。
这些结果覆盖公开基准和网络采集视频,但仍是论文指定数据与基线的平均值。浑浊度、照明、深度和相机运动超出训练分布后,不能直接沿用同样提升幅度。
水下退化同时破坏定位和建图
普通3D高斯流式重建依赖相邻帧外观一致和稳定相机位姿。水下光线随距离衰减,悬浮颗粒产生后向散射,同一表面在不同距离会出现不同颜色。位姿一旦偏移,新加入的高斯也会落到错误位置,误差继续累积。
论文主图:单目视频经过位姿估计、点云初始化和增量高斯更新,得到水下场景重建。
AquaFlow先在大规模水下数据上微调3D视觉基础模型,让它输出相机位姿和点图;再用介质引导的增量初始化,把新帧中的可靠区域加入当前场景。
混合表示同时描述几何和水体成像
系统把结构化、距离条件化的神经高斯与水下光学模型结合。前者表示场景表面,后者补偿不同传播距离上的衰减和散射。这样颜色变化不必全部塞进几何参数,位姿与外观可以在流式更新中分别约束。
论文流程图:水下视频、位姿与点图预测、介质引导初始化和混合场景表示。
新帧只增量更新相关高斯,不需要每到一帧都从头优化完整场景。论文报告的运行时间仍受基础模型、分辨率和轨迹长度影响,尚不能把“流式”理解成任何设备都能实时运行。
62条轨迹覆盖不同水域和尺度
测试集合并公开数据与网络视频,包含浅海、沙地、珊瑚、洞穴、沉船和人工设施等环境。轨迹来自不同尺度和相机运动,为颜色退化与低纹理提供更复杂的组合。
论文数据图:62条测试轨迹覆盖多种水下场景、能见度与运动条件。
定位比较看绝对轨迹误差,渲染比较使用PSNR等指标。平均定位误差降低13.2%、PSNR提高4.74 dB,比较对象是WaterSplat-SLAM。部分传统水下重建方法并非流式单目设置,不能直接用相同速度和输入条件横向比较。
测试轨迹要求相邻画面具有足够重叠,并经过几何一致性检查。快速转身、长时间只拍均匀水体或完全失去纹理时,单目系统仍可能无法初始化;数据筛选条件应与结果一起理解。
论文渲染结果:多种方法在不同水下序列上的重建画面与局部细节。
消融把收益拆到微调、介质和几何模块
去掉水下微调后,基础模型的位姿与点图估计明显变差;移除介质初始化或距离条件模块,也会出现结构缺口和颜色偏差。消融图支持各模块都参与最终结果,但定性局部不能替代全数据集平均指标。
论文消融图:完整模型与移除水下微调、介质初始化等组件后的局部重建。
下一步是进入机器人与长期测绘
水下机器人巡检、珊瑚记录和沉船数字化都需要边移动边构建场景。部署前还要测试传感器外壳折射、照明变化、强浑浊和回环闭合,并给出长时间运行的显存与地图增长曲线。
数据页公开了部分水下素材。若代码与完整评测协议后续开放,研究者可以检查不同海域上的泛化,并把单目结果与声呐、深度计和惯导融合,降低纯视觉在极端能见度下失效的风险。
长期测绘还要解决同一地点多次经过时的回环与颜色变化。水下灯光方向、潮汐和悬浮物随时间变化,系统应判断差异来自场景改变还是介质改变,避免把光学波动写成新的几何结构。
参考资料
https://arxiv.org/abs/2608.22906