GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
GDPO:多奖励强化学习优化中的组奖励解耦归一化策略优化
机构 * NVIDIA
AI总结 GDPO通过解耦奖励归一化提升多奖励强化学习优化的稳定性和准确性,优于GRPO。
Comments NVIDIA-Tech Report
作者
Natural Language Processing
GDPO:多奖励强化学习优化中的组奖励解耦归一化策略优化
机构 * NVIDIA
AI总结 GDPO通过解耦奖励归一化提升多奖励强化学习优化的稳定性和准确性,优于GRPO。
Comments NVIDIA-Tech Report