Sakana AI与FARS等团队提出的一项自动科研基准,让Sakana AI v1、Sakana AI v2、CycleResearcher和Data-to-Paper围绕15个研究提案各写一篇论文,再让GPT-5.4、Gemini和Claude自动评分。四套系统共生成60篇论文,另有15篇FARS系统生成的参考论文,共75篇。
综合评分使用1至5分。FARS参考论文平均2.27分,四套参评系统约为1.00至1.07分。论文作者据此认为,现有自动科研系统在方法严谨性和研究表达上仍有明显缺口。
论文图1:15个FARS提案被转换成不同系统需要的输入,生成论文后交给三款模型独立评审。
15个题目都来自同一套FARS提案
题目覆盖AI安全和机器学习,包括模型越狱、可解释性、视觉语言对齐和网页智能体评测。研究只选择FARS同时公开数据仓库的15个提案,因为Data-to-Paper必须接收数据集,而不能直接接收研究问题。
Sakana v1和v2每个提案生成三个研究想法和多份LaTeX,研究人员再用大模型把它们合成一篇论文。CycleResearcher与Data-to-Paper各直接生成一篇。所有系统使用GPT-4o进行构思、实验和写作,生成文档为6至15页。
这套设计保证了题目大致一致,也给FARS带来先天优势:提案和配套数据原本由FARS产生,FARS参考论文还是预先生成的成熟输出。结果适合比较这15个题目的完成情况,不能直接当成所有AI科学家系统的通用排行榜。
FARS在四项维度上都领先
综合三名评审后,FARS在原创性、严谨性、清晰度和重要性上的平均分分别为2.00、2.00、2.87和2.00。其他系统多数接近1分;CycleResearcher在非FARS系统中相对最好,清晰度为1.60。
论文图2:FARS参考论文各项得分较高,四套参评系统集中在量表下端。
逐题评分也显示相同趋势。FARS在网页智能体评测题上得到GPT-5.4、Gemini、Claude分别3、4、3分,另外四套系统的综合结果均为1分。
论文表2:每格依次列出GPT-5.4、Gemini、Claude和综合评分。
三名AI审稿人并没有统一标准
Gemini与Claude对75篇论文的排序相关系数为0.907,两者与综合分的相关系数均为0.961。GPT-5.4与Gemini、Claude和综合分的相关系数只有约0.315至0.325。
所有相关性在论文统计中达到显著水平,但强度差距接近三倍。自动评审能快速覆盖大量论文,也会把评审模型自己的偏好带进榜单。没有人类专家盲审对照时,不能把三模型共识直接等同于科研质量。
最快系统一天理论上能写144篇
CycleResearcher平均10分钟生成一篇,API成本17美元,并额外使用GPU进行强化学习,按连续运行计算可达每天144篇。Data-to-Paper为20分钟、9美元和每天72篇;Sakana v1为72分钟和16美元,Sakana v2为88分钟和26美元。
论文表3:FARS论文为预先生成,未进入成本比较;每天篇数只是按运行时间折算。
速度没有换来更高评分。论文中的自动科研系统可以批量组织实验和文档,但低分案例常缺少可执行方法、统计验证和清晰实验细节。一天生成多少篇只反映流水线吞吐,不代表产生了多少可信新知识。
这场评测也需要被再次评测
样本只有15个提案,全部来自FARS,研究领域集中在AI安全与机器学习。Sakana输出经过额外合并,FARS成本缺失,三名评委都是大模型,系统比较并非完全对称。
现有结果能说明自动科研质量差距已经可以被系统化测量,却不能给出最终胜负。更可信的下一步应加入人类专家盲审、代码与结果复现、失败实验检查,并在独立来源的研究问题上重复测试。