VIMPO: Value-Implicit Policy Optimization for LLMs
VIMPO: 值隐式策略优化用于大语言模型
机构 * UC Berkeley(加州大学伯克利分校) ; Yale University(耶鲁大学)
AI总结 提出VIMPO方法,通过KL正则化强化学习的最优条件导出策略隐含值函数,无需训练评论家,实现细粒度信用分配,在数学推理基准上优于GRPO。
作者
AI / Security
VIMPO: 值隐式策略优化用于大语言模型
机构 * UC Berkeley(加州大学伯克利分校) ; Yale University(耶鲁大学)
AI总结 提出VIMPO方法,通过KL正则化强化学习的最优条件导出策略隐含值函数,无需训练评论家,实现细粒度信用分配,在数学推理基准上优于GRPO。