Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
无需搜索的规划:通过离线目标条件强化学习精炼前沿大语言模型
机构 * UC Berkeley(伯克利大学)
AI总结 通过目标条件价值函数引导LLM推理,实现高效多轮交互规划,优于传统RL微调和提示方法。
Comments Published at NeurIPS 2025; 18 pages, 4 figures, 2 tables
作者
Robotics / Reinforcement Learning
无需搜索的规划:通过离线目标条件强化学习精炼前沿大语言模型
机构 * UC Berkeley(伯克利大学)
AI总结 通过目标条件价值函数引导LLM推理,实现高效多轮交互规划,优于传统RL微调和提示方法。
Comments Published at NeurIPS 2025; 18 pages, 4 figures, 2 tables