Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning
样本高效的目标导向自博弈用于离线鲁棒强化学习
机构 * Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Edith Cowan University(埃迪斯·科温大学) ; University of New South Wales(新南威尔士大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。
Comments NeurIPS 2025