复旦大学、浙江大学、帝国理工学院和微软亚洲研究院等机构发布肠镜视觉语言模型EndoCLIP。团队从280476份常规肠镜记录中恢复出125756组病灶图文配对,用医生日常书写的报告替代昂贵的逐帧人工标注。
模型在图文检索、结构化报告生成和六项多中心分类任务上接受测试。在一项良恶性分类盲测中,冻结模型特征后训练的轻量分类器取得0.852的准确率,12名内镜医生中的专家组平均准确率为0.846。
论文图1:常规报告对应多帧和多病灶检查,研究团队从28万余份记录中逐步筛出病灶级图文对。
一份报告对应整场检查,图片与描述原本没有对齐
肠镜报告会记录病灶位置、大小、形态和黏膜表面特征,但一份报告通常对应整场检查,可能包含多帧图像和多个病灶。报告里的某句话没有直接标明它描述的是哪一张图。
EndoCLIP用三阶段流程恢复这种对应关系。模型先根据“有息肉”或“无异常”等粗粒度信息找到可能包含病灶的图像,再从单病灶病例中建立文本与图像锚点,最后处理同一检查中的多个病灶,把不同描述分配给相应图像。
论文图2:模型通过病例级定位、单病灶锚点和多病灶消歧建立图文对应,再用于检索、分类和报告生成。
预训练数据中,44.2%的报告记录至少一个息肉。团队从文本中解析解剖位置、病灶大小,以及19种黏膜和息肉形态描述,再以图文对比学习建立共同表示空间。
只用5%标签,部分任务已经超过对照模型全量训练
研究团队在病理、息肉大小、Paris形态和表面特征等任务上比较EndoCLIP、OpenAI CLIP、BiomedCLIP和PMC-CLIP。
在息肉大小分类中,EndoCLIP只使用5%标签训练线性分类器,AUC达到0.908;三个对照模型使用全部标签时,最高为0.845。在使用全部标签时,EndoCLIP的AUC为0.946。它在六项任务的零样本AUC中也全部高于论文选择的对照编码器。
良恶性分类的医生对照实验包含12名内镜医生,分为不同经验层级,并对病理结果保持盲法。新手组平均准确率为0.716,专家组为0.846,EndoCLIP线性分类器为0.852,AUC为0.941。探索性统计检验显示,模型与专家投票之间没有显著差异。
这个结果只能表述为特定数据集和任务中接近专家。医生面对的是完整检查、动态视频、病史和处置决策,线性分类器面对的是预先选定的数据样本,两者工作范围并不相同。
论文图4:EndoCLIP在病理、形态和表面特征等任务中比较不同标签预算下的分类表现。
生成结构化报告后,仍要由内镜医生审核
团队把不同视觉编码器连接到同一个冻结的Qwen3-14B解码器,只训练中间投影层,让系统输出病灶直径、Paris分型和描述词组成的JSON。
EndoCLIP的描述词集合F1为0.764,Paris分型准确率为0.731,病灶大小平均绝对误差为0.173厘米,均优于论文中的三个对照编码器。它仍会把相邻形态混淆,例如把平坦隆起型病灶判断为无蒂型。
论文图6:冻结视觉编码器与Qwen3-14B解码器,通过中间投影层生成病灶尺寸、分型和描述词。
论文把结构化草稿定位为医生复核工具,没有宣称模型可以自动出具最终报告。报告文本流畅并不能保证定位、尺寸和病灶描述准确,临床流程仍需要人工确认。
同院数据与文本测量限制了外推范围
部分预训练病灶大小来自报告文本解析,并非对原始图像重新测量。EndoReport100虽然没有参与预训练,但仍来自同一机构档案。另一个报告生成数据集缺少患者和视频标识,研究人员无法完全确认所有划分都做到患者级或视频级隔离。
现有证据证明常规报告可以转化为大规模弱监督数据,并在多个中心的数据上迁移。它尚未回答两个产品端问题:模型是否能在前瞻性真实流程中提高效率,以及错误提示会不会改变医生判断。这两项需要独立的临床工作流研究。