论文导读
谷歌DeepMind、伦敦大学学院、牛津大学、苏黎世联邦理工学院等机构联合构建TAPVid-MV,收录284段序列、1142路标定相机流和109769条3D点轨迹。30多种基线仍远未解决任务,多视图跟踪器也不稳定优于单目方法;结论针对该基准及其重建条件,不代表增加相机在所有系统中都无效。
同一个点,要在移动相机之间接力
单目点跟踪只需在一段视频里持续找到同一位置。多视图3D跟踪还要判断不同相机看到的是否是同一个实体,把二维位置恢复到三维空间,并在遮挡后重新建立对应关系。相机本身运动时,物体运动和视角变化会同时影响画面。
TAPVid-MV覆盖DROID、EgoExo4D、Harmony4D、PACE、Hi4D、Waymo和Perpetua七类数据,包含机器人、人类活动、驾驶和合成程序场景。每类数据使用深度、激光雷达、SLAM、人体或物体网格等辅助信息生成轨迹,再由标注者逐段检查。
图:项目页展示七个子集的同步视角、相机运动和3D轨迹。
统一评估几何恢复和点对应
许多方法失败后,很难判断是三维场景重建错了,还是相同点在不同帧和视角之间匹配错了。新基准在同一批数据上同时评估重建与跟踪,把预测相机、点云和轨迹对齐到真实记录,再分别计算误差。
基准共含109769条点轨迹,每条轨迹可能跨多个同步视频并经历遮挡。论文的主视觉把人物、室内和道路场景中的彩色轨迹放在一起,显示任务并不限于静态相机阵列。
图:论文主视觉展示不同场景中由多个相机共同观察的3D轨迹。
多视图方法没有稳定胜过单目方法
团队评估30多种基线,包含原生多视图跟踪器、由二维轨迹提升到三维的方法,以及依赖场景重建的组合方案。结果没有一种方法接近解决任务,多视图跟踪器也未在各子集上稳定超过单目跟踪器。
图:论文定性图比较不同方法在DROID与PACE场景中的几何和轨迹预测。
联合分析把几何恢复识别为主要瓶颈。多一个视角确实提供了补充信息,但如果相机位姿、深度或点云先恢复错误,后续匹配会在错误坐标系里累积偏差;这能解释为何“看得更多”没有自动变成“跟得更准”。
图:论文图A.4并列展示预测相机、几何重建与点轨迹误差。
向机器人和AR应用扩展
这些标注还能用于单目二维、单目三维点跟踪、未来轨迹预测和4D重建。机器人团队可以先在同一序列上检查几何模块,再替换点跟踪模块,避免只看最终误差时无法定位问题。
下一步需要增加低光、快速运动、重复纹理和长时间完全遮挡等条件,并按相机数量和计算预算报告收益。只有明确增加一个视角带来多少精度、时延和标定成本,基准结果才能转化为AR设备、机器人或自动驾驶感知系统的硬件选择。