When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
多智能体强化学习何时能改进LLM工作流?工作流、规模与策略共享的权衡
机构 * Oregon State University(俄勒冈州立大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; Adobe Inc.(Adobe公司) ; AG2AI, Inc.(AG2AI公司)
专题命中 多智能体 :agent(title,abstract);workflow(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
AI总结 研究多智能体LLM工作流中端到端强化学习训练的效果,发现改进依赖于工作流、任务和规模,策略共享不提供统一稳定性而是重新分配失败模式。