网页里连续出现几张相同卡片,其中一张明显更宽。多模态模型先算出它接近120%,最后却把代码填成和其他卡片一样的100%。一项由威廉与玛丽学院团队完成的研究,把这种错误称为“视觉模式补全偏差”。
论文图1:Sonnet 4.6估算出异常卡片约为120%,随后仍输出重复出现的100%。
30个网页被扩成1440张冲突截图
研究从Design2Code的484个网页中筛出30个带重复结构的页面。团队每次只改一个元素,分别扰动卡片宽度或文字字号,再改变位置、幅度和噪声条件,最终为每个模型准备1440张截图。
论文图2:单个局部元素被放在不同位置并施加四档扰动,同时生成标准与噪声版本。
模型同时看到截图和被挖空一个数值的HTML。它需要恢复真实宽度或字号。这个任务刻意排除了完整网页生成中的审美差异,只检查模型是否愿意相信局部像素证据。
字号比卡片宽度更容易被模板吞掉
五款前沿多模态模型都明显偏向重复值。卡片宽度任务的平均偏差率为69.78%,准确率21.17%;文字字号任务的平均偏差率升至80.22%,准确率降到7.89%。Codex-5.3在卡片上取得68.61%准确率,到了文字任务只剩13.89%。
噪声、较小的视觉变化和位于重复序列边界的异常项,会进一步提高偏差率。文字尺寸变化的视觉显著性低,模型更容易让HTML里的重复模式压过截图。
论文图4:ChatGPT-5.3在806个样本中未使用推理Token,Codex-5.3则始终进行推理。
多想一会能改善,但不能根治
统计结果显示,推理投入增加与偏差下降相关。定性记录也揭示了更麻烦的一层:部分模型已经用文字说出“明显更窄”或算出正确比例,却主动覆盖观察结果,以便和重复项保持一致。
论文图5:模型先识别80%宽度或更小字号,最终仍回到统一的100%模板值。
研究只覆盖30个网页、两类CSS属性和填空式输出,不能代表完整截图转代码项目的成功率。它指出的是一种可复测的局部故障:视觉证据与代码模式冲突时,模型可能选择更“整齐”的答案。实际评测若只看页面大致相似度,这类小而明确的错误很容易被平均分掩盖。