On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
在测试时间计算的极限:用于更好推理的顺序奖励过滤
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG
AI总结 本文提出顺序奖励过滤方法,通过选择高奖励生成物优化测试时间计算,提升大语言模型的推理性能。
Comments 45 pages, 6 figures, 3 tables