Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism
长周期基于模型的离线强化学习无需显式保守性
机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学)
专题命中 仿真与规划 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)
AI总结 本文提出NEUBAY算法,通过贝叶斯方法解决长周期rollout中的价值过估计问题,在D4RL和NeoRL基准上取得新进展。
Comments ICML 2026. 50 pages, 15 figures. Code is available at https://github.com/twni2016/neubay