Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
引导推测推断用于大型语言模型的高效测试时间对齐
机构 * Harvard SEAS(哈佛大学SEAS学院) ; Kempner Institute(Kempner研究所) ; IBM Research(IBM研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出引导推测推断(GSI),通过结合软最佳n次测试时间缩放、奖励模型和小型辅助模型的推测样本,提高大语言模型的奖励引导解码效率,并在多个基准测试中实现更高的准确性和更低的延迟。
Comments 41 pages, 11 figures. Published at ICLR 2026