From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning
从求解器反馈到可信规划:用于符号规划的多角色强化学习
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Pace University(佩斯大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出基于求解器的多角色强化学习框架,仅用求解器反馈实现无人工演示的自然语言转PDDL,在PlanBench上显著提升规划成功率与可信性,降低语义漂移。