Reevaluating Policy Gradient Methods for Imperfect-Information Games
重新评估不完美信息博弈的策略梯度方法
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; NYU Tandon School of Engineering(纽约大学坦顿工程学院)
AI总结 通过实现五种大型博弈的精确可剥削性计算,对比发现基于虚构博弈、双预言机和反事实遗憾最小化的深度强化学习算法未能超越通用策略梯度方法(如PPO)。
Comments International Conference on Learning Representations (ICLR) 2026