Robust Data-Collection Policy Learning for Low-Variance Online Policy Evaluation
面向低方差在线策略评估的鲁棒数据收集策略学习
机构 * California Institute of Technology(加州理工学院) ; Massachusetts Institute of Technology(麻省理工学院) ; Purdue University(普渡大学) ; University of California, Riverside(加州大学河滨分校) ; University of Virginia(弗吉尼亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本研究针对强化学习在线策略评估的高方差问题,提出双循环梯度算法学习鲁棒行为策略,其对转移扰动敏感性更低,可降低真实环境评估成本。