SPADE: Self-Play in Adaptive Synthetic Executable Environments
SPADE:自适应合成可执行环境中的自博弈
Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
机构
*
University of Washington(华盛顿大学)
;
Stanford University(斯坦福大学)
;
Northeastern University(东北大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
National University of Singapore(新加坡国立大学)
;
Seoul National University(首尔大学)
;
Stevens Institute of Technology(史蒂文斯理工学院)
;
University of Chicago(芝加哥大学)
Semiparametric Double Reinforcement Learning with Applications to Long-Term Causal Inference
用于长期因果推断的半参数双重强化学习
Lars van der Laan, David Hubbard, Allen Tran, Nathan Kallus, Aurélien Bibaut
机构
*
Department of Statistics, University of Washington, USA(华盛顿大学统计系)
;
Netflix Research, USA(Netflix研究)
;
Cornell Tech, Cornell University, USA(康奈尔科技学院、康奈尔大学)