GDEPO: Group Dual-dynamic and Equal-right Advantage Policy Optimization with Enhanced Training Data Utilization for Sample-Constrained Reinforcement Learning
GDEPO:基于增强训练数据利用的群体双动态和等权优势策略优化
机构 * State Key Laboratory of Engines, Tianjin University(发动机国家重点实验室,天津大学) ; Artificial Intelligence Center, Cylingo Group(Cylingo集团人工智能中心)
专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 GDEPO通过动态补充采样、等权优势和动态补充迭代机制,提升ATP中强化学习的数据利用效率和优化性能。