arXivDaily arXiv每日学术速递 周一至周五更新

作者

Sergey Levine

Robotics / Reinforcement Learning

2026-02-04 至 2026-02-04 共收录 1
2512.04601 2026-02-04 cs.LG cs.CL

Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space

自然语言行为-批评者:在语言空间中可扩展的非策略学习

Joey Hong, Kang Liu, Zhan Ling, Jiecao Chen, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出NLAC算法,利用生成式LLM批评者生成自然语言反馈,实现更高效稳定的LLM智能体训练。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏