Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
样本,而非搜索:重新思考语言模型的测试时间对齐
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.LG
AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。