arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

华为推出ScienceFlow:AI科研Agent会回退重走,24小时拿下70.22%奖牌率

arXiv 2608.14354 cs.AI

让AI连续研究24小时,真正棘手的不是多写几段代码,而是路线走偏后能否及时止损、保留好结果并从可靠节点重新出发。华为诺亚方舟实验室推出ScienceFlow,通过可执行状态快照、证据驱动回退和资源感知调度组织长时程科研Agent,在完整MLE-bench上取得70.22%的Any-Medal奖牌率,比此前结果高4.92个百分点。

机器学习研究包含数据检查、特征工程、模型训练、评估和反复调参。普通Agent往往沿单一对话向前推进:早期判断错误会污染后续记忆,新的实验覆盖旧代码,算力任务互相争抢,最后即使发现方向不对,也很难恢复到某个可工作的版本。ScienceFlow把科研过程从一条聊天链改造成可回溯的状态图。

每个关键实验都留下可执行快照

ScienceFlow在研究过程中保存代码、记忆、证据、模型产物和运行环境等工作区状态。一次实验完成后,Agent不只记录“分数变高了”,还保留能够复现该结果的完整节点。后续路线失败时,系统可以回到历史快照继续探索,而不是依赖模型凭文字描述重建环境。

ScienceFlow通过状态快照、回退和资源调度组织科研流程

ScienceFlow通过状态快照、回退和资源调度组织科研流程。

这种可执行状态转换让长任务拥有类似版本控制的结构:分支可以并行试验,证据不足的节点不会自动覆盖最佳方案,重要产物也不因上下文压缩丢失。对24小时级任务而言,恢复一个可靠中间态往往比重新生成几千行代码更节省预算。

快照同时解决了“结果存在但Agent忘了怎么得到”的问题。评估分数、数据处理脚本、模型权重和结论绑定在同一状态中,后续Agent接手时可以直接运行,而不是从一段摘要猜测依赖关系。长任务由此具备可重复交接的最小单元。

用证据决定继续、回退还是停止

系统通过Evidence-aware State Re-anchoring评估当前路线。验证分数改善、剩余预算充足且新证据支持假设时继续推进;出现不收敛、GPU利用率低、I/O瓶颈或模型上限时,则停止当前分支,回到更有价值的快照重新选择方向。

ScienceFlow根据实验收益和剩余预算决定继续或重新锚定

ScienceFlow根据实验收益和剩余预算决定继续或重新锚定。

决策依据来自真实运行记录与评估结果,而非让语言模型凭感觉宣告成功。阶段门会汇总最佳结果、关键改动和可复用经验,再交给下一阶段。这样既减少在无效超参数上反复烧算力,也能把一次失败提炼成下一条路线的约束。

ScienceFlow还按任务性质管理计算作业:需要GPU的训练、只用CPU的数据分析以及I/O密集型预处理不再无序排队。系统结合预计完成时间、剩余墙钟预算和证据价值决定是否接纳新作业,避免一个耗时实验占满最后几小时却来不及形成有效提交。

24小时完整MLE-bench奖牌率达到70.22%

在MLE-bench完整任务上,ScienceFlow以24小时预算获得70.22%的Any-Medal奖牌率,比此前最佳结果提高4.92个百分点。MLE-bench要求Agent处理真实Kaggle风格的数据、代码和评价指标,最终成绩来自提交质量,而不是只判断研究计划写得是否合理。

ScienceFlow在MLE-bench不同任务上的奖牌表现

ScienceFlow在MLE-bench不同任务上的奖牌表现。

团队还分析了时间、令牌与算力使用,展示状态回退和任务调度如何将资源重新分配给更有希望的实验。该成绩依赖指定模型、24小时预算和基准环境,不能直接等同无人监督完成开放科学发现,但它检验了Agent持续执行、恢复和交付结果的能力。

ScienceFlow消融实验比较不同状态管理策略的贡献

ScienceFlow消融实验比较不同状态管理策略的贡献。

下一步打造可审计的AI科研工作台

ScienceFlow的状态图天然适合人类研究者介入:人可以查看某次提升对应的代码与证据,锁定重要分支,或要求系统从某个快照探索另一种模型。与只输出最终答案的Agent相比,这种过程更容易复现、审计和团队协作。

未来它可以接入文献检索、实验室设备与更细粒度的算力价格,在更长周期内协调多名专职Agent。若每个结论都能回链到数据、代码和运行产物,AI科研系统就有机会从“长时间自动写代码”升级为管理假设、证据和资源的完整实验平台。

参考资料

https://arxiv.org/abs/2608.14354