Training AI Co-Scientists Using Rubric Rewards
利用评分奖励训练AI合作者
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; University of Oxford(牛津大学) ; University of Cambridge(剑桥大学)
AI总结 本文提出利用评分奖励训练AI合作者,通过自动生成研究计划并改进模型性能,实现跨领域泛化和高效训练。
Comments 11 pages in the main paper, total 119 including sample outputs in the Appendix