arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.27214cs.CV

CODE:面向开放世界目标检测的跨模态校准与动态抑制

CODE: Cross-Modal Calibration and Dynamic Suppression for Open World Object Detection

Hao Xu, Zhaoning Shi, Hehe Jin, Bo Ma

首次发表
浏览论文内容

中文总结 AI 辅助

本文针对开放世界目标检测的语义歧义与过度抑制问题,提出含三个互补组件的CODE框架,在真实世界检测基准上超越此前最优方法。

中文摘要 AI 辅助

基于多模态基础模型的开放世界目标检测(OWOD)常因单向文本-视觉匹配产生语义歧义,而刚性异常值惩罚可能过度抑制已知类决策边界附近的未知目标。本文提出CODE(跨模态校准与动态抑制),这是一个包含三个互补组件的统一推理时框架:跨模态联合置信度校准注入全局视觉原型以校准文本驱动的已知类预测;不确定性引导的通用目标性增强从局部视觉响应中测量分类犹豫,以强化潜在未知目标;基于置信度裕度的动态异常值抑制,用感知裕度的调整替代刚性抑制,从而保留模糊的分布外实例。在真实世界检测基准上的实验表明,采用OWL-ViT L/14主干网络时,CODE在任务1中取得21.7的U-mAP和40.8的K-mAP,分别超越此前最优方法2.6和2.3个百分点。

英文摘要

Open World Object Detection (OWOD) built on multimodal foundation models often suffers from semantic ambiguity caused by unidirectional text-to-vision matching, while rigid outlier penalties may over-suppress unknown objects near known-class decision boundaries. We propose CODE (Cross-Modal Calibration and Dynamic Suppression), a unified inference-time framework with three complementary components. Cross-Modal Joint Confidence Calibration injects global visual prototypes to calibrate text-driven known-class predictions. Uncertainty-Guided Universal Objectness Enhancement measures classification hesitation from local visual responses to strengthen potential unknown objects. Dynamic Outlier Suppression via Confidence Margin replaces rigid suppression with a margin-aware adjustment that preserves ambiguous out-of-distribution instances. Experiments on the Real-World Detection benchmark demonstrate that, with the OWL-ViT L/14 backbone, CODE achieves 21.7 U-mAP and 40.8 K-mAP in Task 1, surpassing the previous state of the art by 2.6 and 2.3 points, respectively.

发表机构

  • Beijing Institute of Technology(北京理工大学)

机构由 AI 辅助整理,请以论文原文为准。

补充信息

↑