arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

AI看见了异常像素,仍照着重复模板写错代码

arXiv 2608.03691 cs.AI · cs.CV · cs.SE

网页里连续出现几张相同卡片,其中一张明显更宽。多模态模型先算出它接近120%,最后却把代码填成和其他卡片一样的100%。一项由威廉与玛丽学院团队完成的研究,把这种错误称为“视觉模式补全偏差”。

模型识别异常宽度后仍选择模板值

论文图1:Sonnet 4.6估算出异常卡片约为120%,随后仍输出重复出现的100%。

30个网页被扩成1440张冲突截图

研究从Design2Code的484个网页中筛出30个带重复结构的页面。团队每次只改一个元素,分别扰动卡片宽度或文字字号,再改变位置、幅度和噪声条件,最终为每个模型准备1440张截图。

Pattern2Code基准的构建流程

论文图2:单个局部元素被放在不同位置并施加四档扰动,同时生成标准与噪声版本。

模型同时看到截图和被挖空一个数值的HTML。它需要恢复真实宽度或字号。这个任务刻意排除了完整网页生成中的审美差异,只检查模型是否愿意相信局部像素证据。

字号比卡片宽度更容易被模板吞掉

五款前沿多模态模型都明显偏向重复值。卡片宽度任务的平均偏差率为69.78%,准确率21.17%;文字字号任务的平均偏差率升至80.22%,准确率降到7.89%。Codex-5.3在卡片上取得68.61%准确率,到了文字任务只剩13.89%。

噪声、较小的视觉变化和位于重复序列边界的异常项,会进一步提高偏差率。文字尺寸变化的视觉显著性低,模型更容易让HTML里的重复模式压过截图。

两款OpenAI模型的推理Token分布

论文图4:ChatGPT-5.3在806个样本中未使用推理Token,Codex-5.3则始终进行推理。

多想一会能改善,但不能根治

统计结果显示,推理投入增加与偏差下降相关。定性记录也揭示了更麻烦的一层:部分模型已经用文字说出“明显更窄”或算出正确比例,却主动覆盖观察结果,以便和重复项保持一致。

模型主动覆盖视觉观察的两个案例

论文图5:模型先识别80%宽度或更小字号,最终仍回到统一的100%模板值。

研究只覆盖30个网页、两类CSS属性和填空式输出,不能代表完整截图转代码项目的成功率。它指出的是一种可复测的局部故障:视觉证据与代码模式冲突时,模型可能选择更“整齐”的答案。实际评测若只看页面大致相似度,这类小而明确的错误很容易被平均分掩盖。

参考资料

https://arxiv.org/abs/2608.03691