FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards
FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型
机构 * University of Maryland, College Park(马里兰大学 College Park 分校) ; Cisco Research(思科研究)
AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。