给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。
ASI-Bench: At the Dawn of Artificial Superintelligence
ASI-Bench:人工智能超级智能的黎明
作者
Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie
发表机构
清华大学; 麻省理工学院; 哈佛大学; 卡内基梅隆大学; 密歇根大学; 伊利诺伊大学厄巴纳-香槟分校; 波士顿大学; 昆士兰大学; 中国科学技术大学; 弗拉蒂伦研究所; 微软研究院; AG2 AI公司
展开完整论文资料
作者 Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie
机构 清华大学; 麻省理工学院; 哈佛大学; 卡内基梅隆大学; 密歇根大学; 伊利诺伊大学厄巴纳-香槟分校; 波士顿大学; 昆士兰大学; 中国科学技术大学; 弗拉蒂伦研究所; 微软研究院; AG2 AI公司Tsinghua University; Massachusetts Institute of Technology; Harvard University; Carnegie Mellon University; University of Michigan; University of Illinois Urbana–Champaign; Boston University; University of Queensland; University of Science and Technology of China; Flatiron Institute; Microsoft Research; AG2 AI
Comments 16 pages, 5 figures, 2 tables
AI 总结 研究人员推出首个联合评估AI创新探索与自主科学执行能力的基准ASI-Bench,逐步减少人类方法指导测试AI自主科研能力,发现当前AI仍严重依赖人类指导,该基准面向全球开放邀请贡献。
在18种Agent—模型配置上,提供完整方法指导时平均分为50.91,只给方法名称时降到29.10,连方法也要AI自行确定时降至26.62。末档相较完整指导减少24.29分,降幅约47.7%,论文据此判断当前系统仍强依赖人类研究路线。
不是再答一道题,而是完成一个研究项目
常见知识与推理基准给出边界清楚的问题,模型在已有知识中寻找答案。科研项目包含选题解释、方法选择、实验实现、故障排查、结果分析和证据提交,任一环节出错都可能让最终结论无法验证。
ASI-Bench覆盖11个科学领域的60项任务,由40多名专家投入超过31000小时构建。任务以项目为单位,不只检查最终文字,还要求系统执行分析或实验并提交可被评分器复核的产物。
基准结果显示,随着人类方法指导减少,多套Agent—模型配置的项目得分明显下降。
作者对任务进行专家评审、AI辅助审计、沙箱执行和评分器验证。多层检查是为减少“文字看起来合理但结果无法运行”的情况,也让评分更多落到可复核输出,而不是评审者对文风的主观偏好。
三档提示逐步撤掉人类路线
基准在同一研究项目内逐步减少方法信息。第一档提供完整方法指导,系统主要负责实施;第二档只指定方法,让系统补齐步骤;第三档连方法都不提供,Agent必须判断采用哪条研究路线并完成执行。
任务经过专家设计、审计、沙箱执行与评分器验证,确保输出可以被复查。
这样的对照把“知道怎么做”和“自己决定怎么做”分开。平均分从50.91降到29.10,说明把方法名称扩展成可靠实验计划已经损失大量表现;继续撤掉方法后降到26.62,暴露的是研究方向选择与自主探索仍不稳定。
分数没有降到零,表示系统在部分任务中能自行推进。它也不能被解读为“AI完成了26.62%的科学发现”:基准汇总多项评分,任务领域、难度和可验证方式均由作者设计,数字只在该协议内成立。
18套配置都未摆脱指导依赖
作者评估18种先进Agent—模型组合。总体排序会随任务和配置变化,但共同趋势是指导越少,平均表现越低。论文把这条曲线作为核心结论,而不是挑选某个模型的单项最好成绩。
结果总览按任务领域和系统配置汇总表现,用于观察不同研究类型的难度差异。
项目级任务还放大了长链路误差。模型可能提出合理方法,却在代码、数据、工具或统计检验处失败;也可能生成可运行结果,但研究问题与方法并不匹配。只看最后答案的基准无法区分这些失败来源。
成本也是评价边界。更长推理、更多工具调用和重复实验可能提高成功率,却增加Token、运行时间与外部服务费用。基准记录这类消耗,为比较“多花多少资源换多少研究进展”提供起点。
成本图记录不同系统完成项目时的Token和运行开销,性能比较需要结合资源消耗。
从基准走向可审计科研协作
ASI-Bench更直接的应用是评估科研Agent的工作分工。系统可以先在完整指导档验证执行可靠性,再逐步开放方法设计权;研究者能据不同档位的失败定位问题出在计划、实现还是结果核验。
后续需要外部团队提交新任务、复现评分器,并检查任务是否泄漏到训练数据。高风险领域还应加入伦理审批、数据许可和安全约束,不能只因沙箱结果可运行就允许自动部署。当前结果支持的判断很明确:AI已经能承担部分研究执行,但从问题出发自主选择方法并完成端到端项目,仍远未稳定。
参考资料
https://arxiv.org/abs/2608.17271