Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning
大语言模型增强的合作多智能体强化学习的状态条件稳定化
机构 * National School of Artificial Intelligence (ENSIA)(国立人工智能学院(ENSIA)) ; Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型与合作多智能体强化学习集成时训练动态,指出非策略学习中动态更新奖励权重违反平稳假设。提出基于阶段的冻结计划和指数移动平均平滑两种稳定策略并评估,揭示奖励信号平稳性是必要设计约束。