Non-stationary Bandit Convex Optimization: A Comprehensive Study
非平稳带惩戒凸优化:全面研究
机构 * University of Oxford(牛津大学) ; Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、格勒诺布尔INP、LIG实验室) ; Google Research(谷歌研究)
AI总结 本文提出TEWA-SE和cExO算法,分别在已知和未知非平稳度量下实现带惩戒凸优化的最小化最优遗憾。
Comments 33 pages, 1 figure, accepted at NeurIPS 2025