LEPO: Latent Reasoning Policy Optimization for Large Language Models
LEPO:面向大语言模型的潜在推理策略优化
机构 * Tencent(腾讯) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 LEPO通过引入Gumbel-Softmax在大语言模型中实现可控的随机性,提升其探索能力与强化学习兼容性,通过直接在连续潜在表示上应用强化学习,显著优于现有方法。