arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-03-09 至 2026-03-09 共收录 1
2603.06138 2026-03-09 cs.LG cs.AI

Partial Policy Gradients for RL in LLMs

强化学习在大语言模型中的部分策略梯度

Puneet Mathur, Branislav Kveton, Subhojyoti Mukherjee, Viet Dac Lai

机构 * Adobe Research(Adobe研究)

AI总结 本文提出了一种在大语言模型中使用部分策略梯度的方法,通过优化未来奖励的子集来建模和比较不同策略类别,展示了不同策略在不同任务中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏