Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models
超越令牌级策略梯度:用于大语言模型复杂推理的多令牌策略梯度优化
机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) ; Baidu Inc.(百度公司)
AI总结 本文提出MPO框架,通过多令牌级优化提升大语言模型在复杂推理任务中的性能。