From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones
从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学)
AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。