arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里通义SEE给19个多模态模型出实验题,最强准确率也没过50%

arXiv 2608.06931 cs.AI

能识别显微图、读懂谱图,再据此判断实验结论,和背出科学知识不是一回事。阿里通义、浙江大学、清华大学与中国科学院大学等团队推出SEE,收集1116道以真实实验图像为核心的问题,覆盖19个多模态大模型。标准评测中,模型准确率分布在15.9%到48.7%,最强者也未过半。

题目来自实验,不是百科问答

SEE覆盖化学、生物学和材料科学,并细分为17个子领域。题目证据包括反应路线、显微图、光谱、凝胶图、材料表征和多面板实验结果。很多问题要求模型先定位图中变量,再比较对照组,最后结合实验条件得出结论;只记住一个术语或公式无法完成。

数据集包含1049道公开题和67道保留题。来源指向同行评议文献与实验实践,团队按学科组织问题并检查答案。这样的设置刻意提高视觉证据的重要性:如果遮掉图片,题干往往不足以唯一确定答案。

SEE覆盖的科学领域、图像类型与任务结构

基准把多模态理解放在真实科学证据中,而不是给普通问答附一张装饰图片。

19个模型,最高只有48.7%

团队评测19个多模态模型,整体准确率从15.9%到48.7%。GPT-5.6-Sol Max取得48.7%,Gemini 3.1为45.2%,其他通用和专用模型也未能稳定跨过半数。通用模型平均表现高于部分科学专用模型,说明领域名称相符不等于能处理复杂实验图。

错误并非都来自知识空白。有的模型看错图例颜色,有的把不同面板的条件混在一起,还有的识别出局部趋势,却在最终因果判断时选择相反答案。多图组合尤其容易暴露信息整合问题:每张图单独描述得像样,合起来却无法形成一致推理链。

SEE中的跨化学、生物和材料实验问题样例

同一道题常同时要求图像定位、数值比较、领域知识和实验逻辑。

联网和代码工具能帮忙,也会添乱

SEE还测试带网页检索、代码执行等工具的智能体。公开子集上的最佳工具配置达到52.1%,说明检索背景资料或计算数值确实能补足部分能力。但工具并没有让问题迎刃而解:智能体可能发起错误查询、选择无关网页,或在已有足够证据时继续搜索,最后被外部信息带偏。

工具链的失败可以分成动作选择、信息融合和停止判断。科学问题不是搜到一句相似文字就结束,外部知识必须与题目里的实验条件对齐。若图中处理组、时间点或测量指标不同,再权威的资料也不能代替当前证据。

保留的67道题承担了额外的防泄漏作用:模型开发者可以在公开集上分析错误,但最终结果仍要面对未公开样本。对于来源于论文的科学题,这一点尤其关键,因为模型可能在预训练或检索中见过相似材料。SEE并不能彻底排除记忆影响,却通过视觉依赖设计和保留集,让单纯复述原文更难伪装成实验推理。

不同模型在SEE基准上的准确率比较

标准模型最高分仍低于50%,工具增强虽有改善,但没有消除多模态实验推理缺口。

下一步扩展开放式科学评测

SEE比传统视觉问答更接近科研人员阅读实验结果的过程,可用于区分“会说科学语言”和“会使用科学证据”。对模型开发者而言,分领域和分图像类型结果也能指出具体薄弱项,例如谱图读取、多面板对齐或对照实验推理。

下一步可以在1116道选择题之外加入开放式答案、证据区域标注和专家评分,要求模型指出使用了哪块实验图、如何排除其他结论。这样既能区分真正的证据链与碰巧选对,也能把错误定位到视觉读取、领域知识或实验逻辑。

SEE当前不直接测量提出假设、操作仪器和复现实验。后续若接入代码、文献检索与实验规划工具,可以进一步评估模型能否围绕同一证据完成计算、提出补充实验并说明不确定性。化学、生物和材料三个领域也为扩展更多学科提供了统一题目格式。

参考资料

https://arxiv.org/abs/2608.06931