Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback
零和博弈中的无正则化线性收敛性:从偏好反馈出发
机构 * Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; HKUST(香港科技大学)
AI总结 本文提出了一种无正则化的OMWU算法,证明其在零和博弈中实现线性收敛,无需假设纳什均衡的唯一性,提升了对实例依赖常数的依赖性。
Comments 28 pages