Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving
混合差分奖励:结合时序差分和动作梯度用于高效合作驾驶多智能体强化学习
机构 * School of Automotive Studies, Tongji University(交通学院)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出混合差分奖励机制,结合时序差分和动作梯度,提升多智能体协同驾驶的收敛速度和策略稳定性。