arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Meta&牛津给AI科学家配“选题编辑”:15小时追平原本24小时研究进度

arXiv 2608.13940 cs.AI

AI科研Agent可以一口气提出很多实验,但算力真正花在哪里,往往比想法数量更决定最终成绩。Meta FAIR、牛津大学、伦敦大学学院等团队提出Research Preference Models(RPM),专门比较候选研究动作并挑选更有希望的一条。在端到端实验中,RPM引导的Agent约15小时就追平无引导系统24小时的进度,执行预算不到原来的三分之二。

现有科研Agent通常让同一个大模型提出假设、写代码、选实验并评价自己。候选路线一多,模型容易偏爱表达完整的方案,却未必能判断哪次训练最可能提高最终指标。RPM把“做研究”和“选择下一步研究”拆开,为后者训练一个专门的偏好判断器,角色更像编辑或项目负责人。

不直接生成实验,而是给候选研究动作排序

在搜索树的每个节点,研究Agent先提出多种修改,例如换模型、调整特征、修复数据处理或增加验证。RPM读取当前状态、历史证据与候选动作,预测哪个分支更值得投入算力。被选中的方案实际执行后,真实分数再更新搜索树,形成选择、实验与反馈循环。

RPM在研究搜索树中选择候选实验并用结果更新节点

RPM在研究搜索树中选择候选实验并用结果更新节点。

团队研究了两种用法:只在推理时为候选方案排序,以及加入Agent互动轨迹的更完整选择器。前者容易接入现有科研框架,后者能够利用实验过程中的失败、修复和收益信号,学习“在这个阶段什么动作最值钱”。

用最终科研结果训练“品味”,而不是模仿文字风格

RPM关注候选动作执行后是否带来可验证改进。训练样本将研究状态、两个候选方向与后续结果关联起来,让模型学会比较实际价值。它不要求一句建议看上去像专家意见,而要求该建议在有限时间内更可能导向高分方案。

RPM引导与普通研究Agent的端到端得分随时间变化

RPM引导与普通研究Agent的端到端得分随时间变化。

这种偏好信号适合处理科研中的延迟回报:某次重构短期没有涨分,却可能为后续实验打开空间;某个复杂模型看似新颖,却会耗尽预算。选择器结合当前证据与剩余资源,减少一味追逐即时小幅提升。

研究偏好与普通聊天偏好并不相同。一个解释流畅、术语丰富的建议未必值得执行,真正重要的是它能否在当前代码和数据条件下形成可测改动。RPM将判断对象落到具体候选动作,使训练信号直接对应实验回报,也便于对错误选择做复盘。

约15小时追平24小时进度,两个任务刷新结果

在端到端研究测试中,无引导Agent的归一化得分为0.684;加入不同RPM配置后提升到0.711和0.729。按时间曲线看,引导系统大约15小时达到无引导系统24小时的水平,使用不到三分之二的执行预算,并在两个任务上取得新的最佳结果。

RPM的选择质量与最终研究结果之间呈现关联

RPM的选择质量与最终研究结果之间呈现关联。

这些数据来自指定任务、模型与时间预算,RPM也可能继承训练轨迹中的偏好,忽略真正新颖但早期回报较慢的方向。论文的关键进展,是把实验选择变成可以独立评测和优化的组件,让科研Agent的效率不再只依赖扩大基础模型。

时间曲线比最终分数更能说明实际价值。相同24小时里更高的得分意味着可以继续冲击更复杂方案;若目标只是复现既有水平,则15小时达到同一进度可以直接节省算力和等待。两种收益都来自更少地执行低价值候选,而非让单次训练本身变快。

不同时间预算下RPM对研究效率的影响

不同时间预算下RPM对研究效率的影响。

下一步形成多人分工的AI科研团队

RPM可以进一步承担研究组合管理:一个Agent负责提出大胆假设,一个负责稳健改进,选择器根据证据、风险和预算动态分配计算。人类研究者也可以注入“优先可解释性”或“先验证数据泄漏”等偏好,让系统优化的不只是排行榜分数。

如果选择理由能够回链到实验记录,团队便可审计某条路线为何获得更多算力,并在中途修改研究目标。未来的AI科学家可能不是一个无所不包的模型,而是由研究员、评审、资源调度器和证据管理器共同组成的系统;RPM提供了其中“研究品味”这一关键角色。

参考资料

https://arxiv.org/abs/2608.13940