ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning
ARMS: 稀疏奖励多智能体强化学习的自动奖励塑形
机构 * Department of Marine Technologies(海洋技术系)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 提出ARMS框架,通过自监督轨迹排序学习稠密塑形信号,并基于条件最优反应推理证明其保持纳什均衡,从而解决多智能体强化学习中的稀疏奖励问题。