Constrained Group Relative Policy Optimization
带约束的群体相对策略优化
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 模仿学习与强化学习 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.LG
AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。
Comments 16 pages, 6 figures