Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes
离散动作非马尔可夫奖励决策过程中基于模型的强化学习
机构 * Fondazione Bruno Kessler(布雷诺·科塞拉基金会) ; Sapienza University of Rome(罗马萨皮恩扎大学)
专题命中 模型式强化学习 :model-based reinforcement learning(title);model-based RL(abstract);分类 cs.AI、cs.LG
AI总结 提出QR-MAX算法,通过奖励机分解马尔可夫转移学习与非马尔可夫奖励处理,首次在离散NMRDP中获得PAC收敛到ε-最优策略的多项式样本复杂度,并扩展至连续状态空间。
Comments Accepted at IJCAI-ECAI 2026. 19 pages, 32 figures, includes appendix