arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

月之暗面测试16个多模态模型,视觉准确率无人过60%

arXiv 2607.24957 cs.CV

月之暗面发布多模态评测集PerceptionBench,用3000道短答案题测试16个前沿模型的基础视觉感知。最高准确率为59.7%,排名第二的Kimi K3为58.5%,没有模型达到60%。

这套测试刻意减少知识和复杂推理要求,只检查模型能否看清位置、数量、属性、文字、空间关系和细节。研究团队的判断是,许多被归因于“推理失败”的错误,在第一步读图时就已经发生。

16个多模态模型在PerceptionBench上的总分

论文图1:16个模型的整体准确率均未达到60%,最高两项为59.7%和58.5%。

从42套基准的失败样本倒推十项视觉能力

研究人员没有先列一份主观能力清单。他们汇总42套现有视觉基准中的错误案例,沿模型回答过程寻找最早出错的位置,再把问题分为感知、推理、知识、前提和其他五大类。

其中感知错误被进一步拆成十项:视觉定位、属性识别、计数、关系理解、深度与三维感知、文字识别、视觉比较、细粒度识别、上下文整合和感知幻觉。感知幻觉指模型声称看到了图中并不存在的内容。

团队从超过1.7万道内部样本中选出3000道公开题。1800道由现有失败案例拆成更简单的原子问题,1200道基于补充图片重新编写。十多名专业标注员参与制作,自动检查和独立人工复核会剔除答案含糊、需要外部知识或没有清晰视觉证据的样本。

PerceptionBench从失败归因到样本筛选的构建流程

论文图4:研究先定位模型回答中最早出现的错误,再拆解和筛选只考查单项视觉能力的问题。

总榜第一的模型,幻觉项目只有26.9%

GPT-5.6-Sol以59.7%排在第一,Kimi K3以58.5%排在第二。Gemini 3.1 Pro为56.2%,GPT-5.5为55.8%。16个模型的整体成绩分布在32.5%到59.7%之间。

感知幻觉是平均表现最差的一项,16个模型的平均准确率只有36.7%。总分第一的GPT-5.6-Sol在定位项目达到76.7%,幻觉项目却只有26.9%;总体位于中段的Gemini 3.5 Flash在幻觉项目取得50.6%,反而是该项最高分。

接近的总分也会掩盖能力差异。GPT-5.5和Gemini 3.1 Pro总分只差0.4分,前者的视觉定位高出13分,后者的OCR和细粒度识别各高出约8分。选择模型时只看一个综合榜单,很难判断它是否适合文档识别、界面操作或空间定位等具体工作。

多模态模型在原子视觉问题上的典型错误

论文图6:原始多步问题被拆成计数、定位等原子问题后,模型在读图阶段已经出现分歧。

视觉定位题示例

论文图9节选:视觉定位任务要求模型直接从图像中识别指针或目标位置。

分数稳定,不代表每道题都看得稳定

团队让三个代表模型分别运行四次。Kimi K3的四次总分只在58.2%到58.8%之间波动,说明整体排名较稳定;但它至少一次答对的题占73.9%,四次全部答对的题只有42.7%。GPT-5.6-Sol的对应数字是72.9%和46.9%。

同一模型可能在某次看对、下次看错。应用端如果只做一次推理,稳定性比平均分更重要,尤其是读取表格、医疗影像或操作界面时。

PerceptionBench也有明确边界。它专门从当前模型的失败案例中选题,难度天然偏高;能力分类会随模型迭代和原始42套基准的覆盖范围变化。答案由自动模型判断,但在人类抽查的300个结果中一致了299个。

“无人超过60%”只适用于这套原子视觉专项评测,不能改写成所有多模态模型的综合能力都不及格。公开数据更清楚地说明了一件具体问题:模型输出了一段连贯推理,并不能保证它在第一步已经看对图片。

参考资料

https://arxiv.org/abs/2607.24957