M$^{2}$GRPO: Mamba-based Multi-Agent Group Relative Policy Optimization for Biomimetic Underwater Robots Pursuit
M$^{2}$GRPO:基于Mamba的多智能体群体相对策略优化用于仿生水下机器人追捕
机构 * Baidu Inc.(百度公司)
AI总结 本文提出M$^{2}$GRPO框架,结合选择性状态空间Mamba策略与群体相对策略优化,解决水下机器人追捕中的长时决策、部分可观测性和多机器人协调问题,提升策略的表达性和稳定性。