The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
代理强化学习用于大语言模型的景观:综述
机构 * University of Oxford(牛津大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Brown University(布朗大学) ; University College London(伦敦大学学院) ; University of Science and Technology of China(中国科学技术大学) ; Imperial College London(伦敦帝国学院) ; Dalian University of Technology(大连理工大学) ; Chinese Academy of Sciences(中国科学院) ; The Chinese University of Hong Kong(香港中文大学) ; University of Georgia(佐治亚大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; University of Bristol(布里斯托大学)
AI总结 本文综述了代理强化学习在大语言模型中的应用,提出双分类体系,探讨其核心能力与应用领域,并强调强化学习在使能力转化为适应性行为中的关键作用。
Comments Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O