Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL
外推权重平均揭示代码强化学习中的正确性-效率前沿
机构 * Meta Superintelligence Labs - FAIR(Meta超智能实验室 - FAIR)
AI总结 通过外推权重平均,无需额外RL训练即可扩展微调检查点间的帕累托前沿,在竞争性编程中实现正确性与效率的权衡,并提升推理时性能。
Comments 54 pages