Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random
马尔可夫决策过程中奖励非随机缺失的缺失感知策略的离线评估
机构 * Department of Statistics, University of Michigan at Ann Arbor(密歇根大学安娜堡分校统计学系) ; Department of Statistics(统计学系) ; Applied Probability, University of California at Santa Barbara(加州大学圣巴巴拉分校应用概率系) ; Department of Mathematical Sciences, University of Texas at Dallas(德克萨斯大学达拉斯分校数学科学系)
AI总结 针对奖励非随机缺失的离线强化学习问题,提出基于未来状态作为影子变量的识别方法,并利用桥函数和min-max估计器恢复条件均值奖励,实现缺失感知策略的离线评估。
Comments Accepted at ICML 2026. 31 pages, 6 figures