arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2607.23981cs.CVcs.AI

用于开放世界目标检测的多模态语义概率目标性

Multimodal Semantic-Probabilistic Objectness for Open World Object Detection

发表机构北京航空航天大学计算机科学与工程学院
查看机构详情
  • School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

机构由 AI 辅助整理,请以论文原文为准。

Weijun Tian, Rui Liu

首次发表
浏览论文内容

中文总结 AI 辅助

研究开放世界目标检测问题,提出MSPO轻量级语义校准框架,通过融合已知类别语言语义与视觉目标性来校准预测,在实验中改进了PROB基线,提升了主要指标及PASCAL VOC最终mAP,证明已知类别语义可有效校准概率目标性。

中文摘要 AI 辅助

开放世界目标检测(OWOD)要求检测器识别已知类别,发现来自未见类别的未命名对象,并逐步学习新标注的类别。PROB通过在解码器查询空间中对类别无关的概率目标性进行建模来改善未知发现。然而,仅视觉目标性无法确定类似对象的查询对应于已知的硬实例、未见类别的对象还是背景杂波,导致已知-未知决策边界模糊。我们提出了MSPO,这是一个轻量级语义校准框架,在保留其检测器架构和增量学习协议的同时,用任务感知的已知类别语言先验增强PROB。对于每个当前已知类别,MSPO构建一个扩展的文本描述,涵盖类别属性、视觉外观、典型场景和功能用途,并使用冻结的CLIP文本编码器对其进行编码。解码器查询特征被投影到相同的语义空间,以估计它们从当前已知类别语义中的支持度。这种语义证据与PROB的视觉目标性相融合,以校准已知和未知预测,而不会将OWOD变成开放词汇分类。重要的是,MSPO从不使用未来类别的名称,并且在评估期间所有未见类别都保持未命名。在M-OWODB和S-OWODB上的实验表明,MSPO在主要聚合指标上改进了强大的PROB基线,同时保持了有竞争力的未知召回率。它还改善了早期未知混淆指标,并将PASCAL VOC最终mAP提高了多达2.7个百分点。这些结果表明,在标准OWOD设置下,已知类别语言语义为概率目标性提供了有效的校准信号。

英文摘要

Open-world object detection (OWOD) requires a detector to recognize known categories, discover unnamed objects from unseen categories, and incrementally learn newly annotated classes. PROB improves unknown discovery by modeling class-agnostic probabilistic objectness in the decoder-query space. However, visual objectness alone cannot determine whether an object-like query corresponds to a hard known instance, an unseen-category object, or background clutter, resulting in an ambiguous known-unknown decision boundary. We propose MSPO, a lightweight semantic calibration framework that augments PROB with task-aware known-category language priors while preserving its detector architecture and incremental learning protocol. For each currently known category, MSPO constructs an extended text description covering category attributes, visual appearance, typical scenes, and functional usage, and encodes it using a frozen CLIP text encoder. Decoder query features are projected into the same semantic space to estimate their support from the current known-category semantics. This semantic evidence is fused with PROB's visual objectness to calibrate known and unknown predictions without turning OWOD into open-vocabulary classification. Importantly, MSPO never uses future-category names, and all unseen categories remain unnamed during evaluation. Experiments on M-OWODB and S-OWODB show that MSPO improves the strong PROB baseline on the main aggregate metrics while retaining competitive unknown recall. It also improves early unknown-confusion metrics and raises PASCAL VOC final mAP by up to 2.7 points. These results demonstrate that known-category language semantics provide an effective calibration signal for probabilistic objectness under the standard OWOD setting.

补充信息

↑