Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning
学习 deliberation:基于多智能体强化学习的元策略协作用于代理语言模型
专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);agentic(title);分类 cs.AI
AI总结 本文提出元策略推理框架MPDF,结合SoftRankPO算法,通过学习动态推理策略提升多智能体LLM在复杂推理任务中的性能。