Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning
离线强化学习中边缘化重要性加权的贝尔曼校准
机构 * Stanford University(斯坦福大学) ; Netflix(网飞) ; Cornell University(康奈尔大学)
AI总结 本文针对离线强化学习中边缘化重要性加权的残留占用平衡违反问题,提出等渗贝尔曼校准方法,可减少此类违反并保证下游策略价值估计等任务的性能。
Comments 43 pages, 1 figure, 4 tables