NashPG: A Policy Gradient Method with Iteratively Refined Regularization for Finding Nash Equilibria
NashPG: 一种通过迭代细化正则化寻找纳什均衡的策略梯度方法
机构 * University of Sydney(悉尼大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出NashPG算法,通过在策略优化目标中直接引入正则化,解决了多智能体强化学习中两玩家零和不完全信息游戏寻找纳什均衡的挑战,实现了在经典基准游戏和大型领域中的高效收敛与高收益。
Comments Transactions on Machine Learning Research (TMLR), 2026