arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

2025-12-02 至 2025-12-02 共收录 1
2512.00352 2025-12-02 cs.LG stat.ML

Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning

样本高效的目标导向自博弈用于离线鲁棒强化学习

Na Li, Zewu Zheng, Wei Ni, Hangguan Shan, Wenjie Zhang, Xinyu Li

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Edith Cowan University(埃迪斯·科温大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏