Learning Upper Lower Value Envelopes to Shape Online RL: A Principled Approach
学习上下值包络以塑造在线强化学习:一种原则性方法
机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris) ; Wiremind Cargo 16 Bd Poissonnière 75009 Paris ; Modal’X, Université Paris-Nanterre, 92000 Nanterre(Modal’X, Université Paris-Nanterre, 92000 Nanterre)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 提出一种两阶段框架,利用离线数据学习值函数的上下界,并将其融入在线算法,通过解耦上下界实现更灵活紧致的近似,理论分析给出高概率遗憾界,实验表明显著降低遗憾。
Comments 35 pages, 5 figures