Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space
自然语言行为-批评者:在语言空间中可扩展的非策略学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出NLAC算法,利用生成式LLM批评者生成自然语言反馈,实现更高效稳定的LLM智能体训练。
Comments 21 pages, 4 figures
作者
Robotics / Reinforcement Learning
自然语言行为-批评者:在语言空间中可扩展的非策略学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出NLAC算法,利用生成式LLM批评者生成自然语言反馈,实现更高效稳定的LLM智能体训练。
Comments 21 pages, 4 figures