Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback
基于交互的 contextual Markov 决策过程学习与个性化反馈
机构 * University of Iowa(爱荷华大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Southern California(南加州大学) ; Microsoft Research(微软研究院)
AI总结 本文提出了一种计算高效的算法,用于在具有个性化反馈的上下文性 Markov 决策过程中实现次线性遗憾保证,通过扩展奖励估计器构造并设计逆间隙加权算法,有效提升了多轮交互中学习个性化目标的能力。