Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Normal University(北京师范大学) ; National University of Singapore(新加坡国立大学)
AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。
Comments Accepted to EMNLP 2026 main conference