论文导读
香港中文大学、上海人工智能实验室、复旦大学和上海交通大学团队推出SciDocBench,用124道专家编写问题测试AI能否读懂完整科学论文;每题配四种文档表示,共496个实例。受测系统中最高得分为62.6/100。“最强”仅指论文表3所列系统,榜单不代表全部科研助手能力。
会总结摘要,不代表能完成科研阅读
真实读论文常要从方法段找实验设置,在图表里读取数值,再回到附录核对定义。有些问题跨越多页,答案还必须指出证据。许多评测把论文裁成短文本或只问局部事实,模型即使忽略版面、公式与图,也可能凭关键词拿高分。
SciDocBench要求系统面对完整PDF,并把任务划分为科学信息提取、方法与实验理解、结果推理、跨区域证据整合等类别。问题由相关领域专家撰写,覆盖八个大的科学领域、5895个语义任务;这里的“任务”是细分能力与文档实例组合,不是5895篇论文。
图:论文图4给出科学文档理解的任务分类,覆盖信息提取、推理与证据核验。
124道题为何扩成496个实例
同一道问题分别提供原始PDF、解析文本、页面图像或其他结构化表示,可以区分模型能力与文档预处理的影响。如果系统在纯文本上答对、在PDF上失败,问题可能来自布局解析;若各种表示都失败,更可能是证据搜索或科学推理不足。
数据制作也设置双重检查。专家在界面中选择论文、写问题与标准答案,另一位审阅者独立核对题目是否可回答、证据是否充分。模型生成的候选答案再经过盲审,用统一评分标准区分正确、部分正确和错误,尽量减少自动裁判自说自话。
图:论文附录界面展示专家上传PDF、选择能力类别、撰写问题与标准答案的流程。
最高62.6分,难点集中在找证据和读图表
论文表3比较多种前沿多模态模型与科研智能体,最高系统得到62.6/100,离专家水平仍有明显距离。模型对局部文字事实相对稳健,但在跨页检索、图表数值、实验复现条件和需要多步组合的题目上更容易丢分。不同文档表示之间的差距也说明,PDF解析质量会直接限制上层推理。
62.6不是某个模型对所有论文阅读的绝对能力分。它取决于124道题、四种输入表示、评分规则及受测版本;部分答案还使用模型辅助评分。因此标题使用“最强”时必须绑定“本论文表3所列系统”,不能延伸成市场上所有模型的总排名。
图:论文附录盲审界面将参考答案与模型答案并列,并要求审阅者按证据给分。
下一步:让科研助手给出可检查路径
这套基准的价值不只是再做一张榜单,而是把失败拆成文档解析、检索、图表理解和科学推理。开发者可据此测试引用定位、页面回跳、结构化表格提取等具体模块,并把答案与原文证据一起呈现给研究者。
后续仍需扩大论文领域、问题数量和非英语文档,并减少裁判模型偏差。对实际科研工作,正确答案之外还要测时间、成本、引用完整性和“不确定时拒答”。SciDocBench提醒我们:流畅总结只是入口,可核验地读完整论文才是科研助手的核心能力。