arXivDaily arXiv每日学术速递 周一至周五更新

作者

Sergey Levine

Robotics / Reinforcement Learning

2025-12-04 至 2025-12-04 共收录 1
2505.18098 2025-12-04 cs.CL cs.AI

Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL

无需搜索的规划:通过离线目标条件强化学习精炼前沿大语言模型

Joey Hong, Anca Dragan, Sergey Levine

机构 * UC Berkeley(伯克利大学)

AI总结 通过目标条件价值函数引导LLM推理,实现高效多轮交互规划,优于传统RL微调和提示方法。

Comments Published at NeurIPS 2025; 18 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏