arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

2026-01-07 至 2026-01-07 共收录 2
2601.03015 2026-01-07 cs.LG cs.AI

In-Context Reinforcement Learning through Bayesian Fusion of Context and Value Prior

通过贝叶斯融合上下文和价值先验实现上下文强化学习

Anaïs Berkes, Vincent Taboga, Donna Vakalis, David Rolnick, Yoshua Bengio

机构 * University of Cambridge(剑桥大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学)

AI总结 SPICE通过贝叶斯融合上下文和价值先验,实现高效适应未见过的环境,减少遗憾并保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12043 2026-01-07 cs.LG

Information-Theoretic Generalization Bounds of Replay-based Continual Learning

基于回放的持续学习的信息论泛化界限

Wen Wen, Tieliang Gong, Zeyu Gao, Yunjiao Zhang, Weizhan Zhang, Yong-Jin Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Oncology, University of Cambridge(剑桥大学肿瘤学系) China Telecom, China(中国电信) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出了一种基于回放的持续学习的信息论泛化界限理论框架,通过分析内存缓冲区与当前任务的相互作用,建立了更精确的泛化性能评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏