Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
样本,而非搜索:重新思考语言模型的测试时间对齐
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。
高校专区
样本,而非搜索:重新思考语言模型的测试时间对齐
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。