DualPathOcc:用于3D占用预测的双分辨率BEV编码器
DualPathOcc: Dual-Resolution BEV Encoder for 3D Occupancy Prediction
浏览论文内容
中文总结 AI 辅助
DualPathOcc提出双分辨率BEV编码器,结合空间增强与高度感知损失,在无深度监督下实现3D占用预测,于Occ3D-nuScenes达37.37 mIoU。
中文摘要 AI 辅助
从多视角图像预测3D占用需要在2D到3D提升过程中保留几何细节,同时推理稀疏的体积场景表示。我们提出了DualPathOcc,一个基于相机的方法,结合了用于BEV压缩前高分辨率特征聚合的空间增强器、用于局部-全局上下文建模的SENet增强双路径BEV编码器,以及用于近地面占用的高度感知加权交叉熵。最终模型使用占用监督进行优化,且不依赖显式深度损失。在单帧Occ3D-nuScenes上,DualPathOcc达到了37.37 mIoU。我们进一步分析了表面中心深度目标与体积占用学习之间的相互作用。
英文摘要
Predicting 3D occupancy from multi-view images requires preserving geometric detail during 2D-to-3D lifting while reasoning over sparse, volumetric scene representations. We present DualPathOcc, a camera-based framework that combines a Spatial Enhancer for high-resolution feature aggregation before BEV compression, a SENet-augmented dual-path BEV encoder for local-global context modeling, and height-aware weighted cross-entropy for near-ground occupancy. The final model is optimized with occupancy supervision and no explicit depth loss. On single-frame Occ3D-nuScenes, DualPathOcc achieves 37.37 mIoU. We further analyze how surface-centered depth targets interact with volumetric occupancy learning.
发表机构
- University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)
- Shanghai Maritime University(上海海事大学)
机构由 AI 辅助整理,请以论文原文为准。