arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2609.31716cs.CVcs.ROeess.IV

PanOVOcc:具有长期空间体素记忆的全景具身开放词汇占据映射

PanOVOcc: Panoramic Embodied Open-Vocabulary Occupancy Mapping with Long-term Spatial Voxel Memory

Di Kuang, Mengfei Duan, Yuhang Wang, Weixing Peng, Kailun Yang

首次发表
浏览论文内容

中文总结 AI 辅助

提出无训练框架PanOVOcc,统一全景SLAM、开放词汇感知与长期空间体素记忆,实现持久开放词汇语义占据映射,并在两个新基准上显著提升占据IoU和语义mIoU。

中文摘要 AI 辅助

持久语义占据映射对于具身场景理解至关重要。然而,基于透视的系统提供有限的空间覆盖,而现有的全景方法主要从单次观测预测局部体积。我们引入了PanOVOcc,一种从全景序列进行持久开放词汇语义占据映射的无训练框架。PanOVOcc在一个在线架构中统一了全景SLAM、开放词汇感知和长期空间体素记忆,持续将几何和语义证据整合到全局、可语言查询的地图中。为了促进对该设置的系统评估,我们建立了Pan-Replica和Pan-Holo360D两个基准,将连续全景RGB-D序列与合成和真实世界场景中的场景级语义占据真值配对。与每个指标的最强评估基线相比,PanOVOcc在Pan-Replica上将占据IoU和语义mIoU分别绝对提高了+20.03和+7.06,在Pan-Holo360D上分别提高了+43.26和+20.16。源代码和建立的基准将在该https URL上提供。

英文摘要

Persistent semantic occupancy mapping is essential for embodied scene understanding. However, perspective-based systems provide limited spatial coverage, while existing panoramic methods primarily predict local volumes from single observations. We introduce PanOVOcc, a training-free framework for persistent open-vocabulary semantic occupancy mapping from panoramic sequences. PanOVOcc unifies panoramic SLAM, open-vocabulary perception, and long-term spatial voxel memory within an online architecture, continuously integrating geometric and semantic evidence into a global, language-queryable map. To facilitate systematic evaluation of this setting, we establish Pan-Replica and Pan-Holo360D, two benchmarks pairing continuous panoramic RGB-D sequences with scene-level semantic occupancy ground truth across synthetic and real-world scenes. Compared with the strongest evaluated baseline for each metric, PanOVOcc improves occupancy IoU and semantic mIoU by absolute +20.03 and +7.06 on Pan-Replica, and by +43.26 and +20.16 on Pan-Holo360D, respectively. The source code and the established benchmarks will be available at https://github.com/bakereet/PanOVOcc.

补充信息

↑