arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

WSPolypNet:结肠镜检查视频中的弱监督息肉定位

WSPolypNet: Weakly Supervised Polyp Localization in Colonoscopy Videos

Giseong Hwang, Minjae Jo, Yeonghyeon Park, Kyeonghun Kim, Seoyeon Han, Donghoon Han, Haneul Kim, Yului Jeong, Insung Hwang, Pa Hong, Ken Ying-Kai Liao, Nam-Joon Kim

arXiv 2609.08182首次发表:更新:

发表机构

Soonchunhyang University; Seoul National University; Kyungpook National University; OUTTA; Chung-Ang University; Samsung Changwon Hospital; NVIDIA AI Technology Center(顺天乡大学; 首尔大学; 庆北国立大学; OUTTA; 中央大学; 三星昌原医院; 英伟达人工智能技术中心)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

WSPolypNet利用视频级标签和3D CNN生成CAM,结合多视角策略与MedSAM2分割,实现结肠镜视频中弱监督息肉定位,显著提升定位精度并减少标注需求。

AI 中文摘要

由于结肠镜检查视频的密集帧级标注成本高昂,我们提出了WSPolypNet,一个仅使用视频级标签进行息肉定位的弱监督框架。WSPolypNet采用一个以视频级监督训练的3D卷积神经网络来生成类激活图(CAMs),这些图能够识别候选息肉区域,而无需帧级空间标注。通过多视角策略进一步增强CAM衍生的定位线索,并将其作为点提示提供给MedSAM2。随后,MedSAM2在视频中传播分割掩码,根据息肉边界细化粗定位线索。WSPolypNet在IoU阈值为0.3、0.5和0.7时分别取得了47.80%、43.68%和35.01%的CorLoc分数,而单视角设置下分别为36.87%、33.72%和27.94%。对于小息肉,多视角策略将CorLoc@0.5从16.01%提升至30.97%。该框架还实现了94.51%的召回率。这些结果表明,弱监督时空学习在显著减少结肠镜检查视频中息肉定位的空间标注需求方面具有潜力。

英文摘要

Because dense frame-level annotation of colonoscopy videos is costly, we propose WSPolypNet, a weakly supervised framework for polyp localization using only video-level labels. WSPolypNet employs a 3D convolutional neural network trained with video-level supervision to generate class activation maps (CAMs), which identify candidate polyp regions without requiring frame-level spatial annotations. The CAM-derived localization cues are further enhanced using a multi-view strategy and provided to MedSAM2 as point prompts. MedSAM2 then propagates segmentation masks across the video, refining the coarse localization cues according to polyp boundaries. WSPolypNet achieved CorLoc scores of 47.80%, 43.68%, and 35.01% at IoU thresholds of 0.3, 0.5, and 0.7, respectively, compared with 36.87%, 33.72%, and 27.94% in the single-view setting. For small polyps, the multi-view strategy improved CorLoc@0.5 from 16.01% to 30.97%. The framework also achieved a recall of 94.51%. These results demonstrate the potential of weakly supervised spatiotemporal learning to substantially reduce spatial annotation requirements for polyp localization in colonoscopy videos.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑