Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
数学对象推理:在线奖励建模与测试时间聚合
机构 * FAIR at Meta(Meta旗下的FAIR)
AI总结 本文提出改进数学对象推理的三个贡献:构建数学对象推导的训练数据和基准Principia套件,提供强LLM判官和验证器的训练方案,展示在线训练可提升测试时计算能力。
作者
Natural Language Processing
数学对象推理:在线奖励建模与测试时间聚合
机构 * FAIR at Meta(Meta旗下的FAIR)
AI总结 本文提出改进数学对象推理的三个贡献:构建数学对象推导的训练数据和基准Principia套件,提供强LLM判官和验证器的训练方案,展示在线训练可提升测试时计算能力。