Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
多任务GRPO:跨任务的可靠大语言模型推理
机构 * UCL Department of EEE(伦敦大学学院电子工程系) ; UCL Centre for AI(伦敦大学学院人工智能中心) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; UNIST Graduate School of AI(延世大学人工智能研究生院) ; University of Edinburgh(爱丁堡大学) ; University of Basel(巴塞尔大学)
AI总结 本文提出MT-GRPO算法,通过动态调整任务权重和比例保持采样器,提升多任务场景下大语言模型的可靠推理性能。
Comments Accepted at ICML 2026