In-Context Reinforcement Learning through Bayesian Fusion of Context and Value Prior
通过贝叶斯融合上下文和价值先验实现上下文强化学习
机构 * University of Cambridge(剑桥大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学)
AI总结 SPICE通过贝叶斯融合上下文和价值先验,实现高效适应未见过的环境,减少遗憾并保持鲁棒性。