Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning
面向进度和可靠性的智能体强化学习组策略优化
机构 * Baidu Inc.(百度公司) ; Peking University(北京大学)
AI总结 研究基于组的强化学习,针对步级优势估计对组形成方式敏感的问题,提出ProGPO方法,通过精确前缀动作比较及结合语义扩展与逆方差融合估计势,在任务中改进了基线方法。