当被要求描述一张从未提供的医学图像时,前沿视觉语言模型不会弃权,而是会编造诊断结果。更关键的是,这些编造不是随机的——它高度依赖于患者的人口统计学特征。卡内基梅隆大学和亚马逊云科技的研究人员发现了这一现象,测试涉及Claude Opus-4.7、GPT-5.4和Gemini-3.1-Pro三款模型。
这项工作被命名为Hearsay,取的正是"道听途说"之意——模型没有看到任何影像,却像见过一样开口给出结论。研究团队关心的不只是模型会不会答错,而是它在缺少关键输入时,究竟依据什么来填补空白。
给一个特征,不要图片,模型就做出了诊断
研究设计非常简单:仅向模型提供一个人口统计学描述符(如"65岁白人男性"),加上一个检查部位(如"皮肤痣"),不附任何图像,然后要求模型做出医学诊断。
结果令人不安。Claude Opus-4.7的表现最为集中:一名65岁白人男性问皮肤痣,几乎每次回复都给出黑色素瘤诊断。一名32岁黑人女性询问胸部X光时,Claude给出的诊断是结节病,推理过程写着"基于人口统计学特征和典型模式疑似"。
GPT-5.4的影响更广泛,在所有测试的人口统计学类别中都会编造诊断,最显著的是为胸部X光检查的年轻黑人患者命名结节病。Gemini-3.1-Pro也有类似行为,但模式略有不同。
这里最值得警惕的地方在于,这些诊断并非胡乱猜测。它们在医学统计意义上是"合理"的——黑色素瘤在中老年白人男性中确实高发,结节病在年轻黑人女性中的患病率也确实更高。模型把群体层面的流行病学先验,直接套用到了个体诊断上。而在没有影像的情况下,这种套用等于把统计相关性当成了个人诊断依据。
"双面诊断":文本说没图,诊断字段却给疾病
研究发现了更隐蔽的问题:一种"模糊机制"——模型在自然语言文本中承认"没有图像无法诊断",但同时在结构化诊断字段中明确给出疾病名称。这种分离在仅检查文本回复的审计中完全不可见。
在Claude的回复中,约66%的虚构案例存在这种"双面"现象:文本部分说"缺少图像",但诊断字段却给出了具体的黑色素瘤诊断。这意味着,如果只是对模型回复做文本层面的审核,这些编造根本不会被发现。
研究团队强调,直接审计结构化输出通道是发现这类问题的必要条件。
这也解释了为什么此前的评测很难捕捉到这个问题。多数安全评估看的是模型"说了什么",而结构化字段是给机器读的,往往被当作附属产物跳过。一旦下游系统只取诊断字段的值,那句"缺少图像无法判断"的免责声明就不会传递到任何人眼前。
图:不同模型在缺失图像条件下生成诊断内容的比例热力图。
"皮肤痣"和"皮肤病变"只差两个字,结果完全不同
研究还发现了一个微妙的敏感性:当Claude的提示词从"皮肤痣"换成"皮肤病变"时,Claude的编造效应完全消失。而GPT-5.4的效应则没有变化。
这说明VLM的编造并非单一现象,而是一系列不同的失败模式。某些模型对特定词汇高度敏感,另一些模型则不受影响。这种"探针词敏感性"应该成为VLM评估的一个标准维度——在临床部署前,不仅需要测试模型在正常使用时是否准确,还需要测试在不同措辞下是否会出现不一致的编造行为。
图:缺失图像信号与随机噪声输入下的错误诊断比例对比。
对临床部署的直接警示
这项研究是一个受控实验,不代表VLM在真实临床场景中的表现——真实场景中医生通常不会在无图情况下要求模型诊断。但问题在于,如果VLM在结构化输出中存在这种"双面"行为,那么在实际应用中,这些输出可能会被下游系统自动处理,而不会有人去检查文本回复中是否包含了"缺少图像"的声明。
研究建议,在临床流程中可信赖地部署VLM需要:直接审计结构化输出通道,而非仅依赖文本回复检查;将探针词敏感性作为一级评估维度;在测试集中包含仅提供人口统计学描述符的无图像情况。