月之暗面发布多模态评测集PerceptionBench,用3000道短答案题测试16个前沿模型的基础视觉感知。最高准确率为59.7%,排名第二的Kimi K3为58.5%,没有模型达到60%。
这套测试刻意减少知识和复杂推理要求,只检查模型能否看清位置、数量、属性、文字、空间关系和细节。研究团队的判断是,许多被归因于“推理失败”的错误,在第一步读图时就已经发生。
论文图1:16个模型的整体准确率均未达到60%,最高两项为59.7%和58.5%。
从42套基准的失败样本倒推十项视觉能力
研究人员没有先列一份主观能力清单。他们汇总42套现有视觉基准中的错误案例,沿模型回答过程寻找最早出错的位置,再把问题分为感知、推理、知识、前提和其他五大类。
其中感知错误被进一步拆成十项:视觉定位、属性识别、计数、关系理解、深度与三维感知、文字识别、视觉比较、细粒度识别、上下文整合和感知幻觉。感知幻觉指模型声称看到了图中并不存在的内容。
团队从超过1.7万道内部样本中选出3000道公开题。1800道由现有失败案例拆成更简单的原子问题,1200道基于补充图片重新编写。十多名专业标注员参与制作,自动检查和独立人工复核会剔除答案含糊、需要外部知识或没有清晰视觉证据的样本。
论文图4:研究先定位模型回答中最早出现的错误,再拆解和筛选只考查单项视觉能力的问题。
总榜第一的模型,幻觉项目只有26.9%
GPT-5.6-Sol以59.7%排在第一,Kimi K3以58.5%排在第二。Gemini 3.1 Pro为56.2%,GPT-5.5为55.8%。16个模型的整体成绩分布在32.5%到59.7%之间。
感知幻觉是平均表现最差的一项,16个模型的平均准确率只有36.7%。总分第一的GPT-5.6-Sol在定位项目达到76.7%,幻觉项目却只有26.9%;总体位于中段的Gemini 3.5 Flash在幻觉项目取得50.6%,反而是该项最高分。
接近的总分也会掩盖能力差异。GPT-5.5和Gemini 3.1 Pro总分只差0.4分,前者的视觉定位高出13分,后者的OCR和细粒度识别各高出约8分。选择模型时只看一个综合榜单,很难判断它是否适合文档识别、界面操作或空间定位等具体工作。
论文图6:原始多步问题被拆成计数、定位等原子问题后,模型在读图阶段已经出现分歧。
论文图9节选:视觉定位任务要求模型直接从图像中识别指针或目标位置。
分数稳定,不代表每道题都看得稳定
团队让三个代表模型分别运行四次。Kimi K3的四次总分只在58.2%到58.8%之间波动,说明整体排名较稳定;但它至少一次答对的题占73.9%,四次全部答对的题只有42.7%。GPT-5.6-Sol的对应数字是72.9%和46.9%。
同一模型可能在某次看对、下次看错。应用端如果只做一次推理,稳定性比平均分更重要,尤其是读取表格、医疗影像或操作界面时。
PerceptionBench也有明确边界。它专门从当前模型的失败案例中选题,难度天然偏高;能力分类会随模型迭代和原始42套基准的覆盖范围变化。答案由自动模型判断,但在人类抽查的300个结果中一致了299个。
“无人超过60%”只适用于这套原子视觉专项评测,不能改写成所有多模态模型的综合能力都不及格。公开数据更清楚地说明了一件具体问题:模型输出了一段连贯推理,并不能保证它在第一步已经看对图片。