北京大学、清华大学和鹏城实验室的研究人员联合提出了主动事件立体视觉,把双目事件相机和红外二维图案投射器组合成一套新的深度感知方案,用于高速运动下的稠密深度重建。团队搭建了双目事件相机原型,发布了真实与合成两个数据集,分别带21.5k个15Hz时空同步标注和23.8k个20Hz同步标注。配套的ActiveEventNet+网络在真实数据上平均EPE降到1.077,相比帧相机立体匹配模型UniMatch推理提速2.9倍。该工作已被TPAMI接收。
帧相机的物理天花板
主动双目立体视觉是机器人避障和工业测量的常用方案:投射器向场景投出图案,双目相机拍摄后做立体匹配得到深度。但它的成像单元是帧相机,曝光时间内景物必须相对静止。电机一转、机械臂一挥,画面糊了,深度也随之崩坏。
事件相机是另一条路线:每个像素独立响应亮度变化,运动越快事件越密,几乎没有运动模糊。但事件相机只记录「变化」,静止场景里没有输出,纯事件的立体匹配在弱纹理区域也缺少约束。
这套方案的思路是把两条路线的互补性用足:事件相机负责高速,主动投射负责纹理。红外图案投到场景上,双目事件相机捕捉图案被高速运动调制的响应,立体匹配在事件域完成。
原型、数据集与网络
团队搭建的双目事件相机原型包含两台事件相机和一个红外图案投射器,并给出标定流程。真实数据集带超过21.5k个时空同步的稠密深度标注,频率15Hz;合成数据集包含双目事件流和23.8k个20Hz同步标注,还按有效深度像素比例把标注分成高密度、超高密度和一般密度三档。
网络方面,ActiveEventNet+采用轻量的特征提取加动态代价体交互设计,附带一个时间一致性模块,事件 bin 大小取3,压缩率取0.95来平衡精度与速度。
图:主动事件立体视觉的框架。红外图案投射、双目事件流、特征提取与代价体交互、稠密深度输出,配套MobileNet轻量特征提取(论文Fig. 7)。
精度与速度的账
在真实数据集上,ActiveEventNet+的平均EPE为1.077,RMSE为2.078,D1-all为0.056;相比被动事件立体,EPE、RMSE和D1-all分别降低0.279、0.063和0.048。和最好的帧相机立体匹配模型UniMatch相比,它在达到更高精度的同时,推理时间快了2.9倍。
轻量化是刻意的。把标准卷积换成MobileNet v2模块后,精度只有轻微下降,特征提取与编解码模块的推理时间分别缩短约2.5倍和1.6倍;整体推理时间减少近5.2倍,EPE的绝对增加仅0.097。对部署在机器人上的感知模块,这笔交换很划算。
图:高速运动场景下的深度重建。帧相机方案出现运动模糊时,事件立体仍能输出稳定深度(论文Fig. 12)。
图:双目事件相机原型、标定视图与室内外同步实例(论文Figure 1)。
和帧相机方案同台对比
在真实世界实例的对比中,团队把主动事件立体与多种被动事件立体方法放在同一测试集上衡量。主动投射带来的纹理约束在弱纹理和高速两类场景里最占便宜:图案是可控的,不依赖场景本身的长得怎么样。
图:真实场景实例对比。不同方法在室内外序列上的深度估计结果与误差(论文Figure 8)。
从原型走向机器人与工业现场
这套系统的直接应用场景是高速运动下的机器人感知:高速机械臂抓取、无人机避障、工业产线上的运动件测量。事件相机微秒级延迟加主动投射的纹理保证,组合出的正是这类场景需要的感知特性。
要走到产线还有几道坎:红外图案在户外强光下的信噪比、多套设备同场工作的图案串扰、以及事件相机相对帧相机的成本。论文的数据集和网络已经开源,下一步就看硬件集成和更多真实场景的验证。