arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Huawei(华为)

2026-08-06 至 2026-08-06 共收录 1
2602.05547 2026-08-06 cs.CL cs.AI cs.LG 版本更新

Multi-Task GRPO: Reliable LLM Reasoning Across Tasks

多任务GRPO:跨任务的可靠大语言模型推理

Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer, Sangwoong Yoon, Zhiyong Wang, Haitham Bou Ammar, Aurelien Lucchi, Ilija Bogunovic

机构 * UCL Department of EEE(伦敦大学学院电子工程系) UCL Centre for AI(伦敦大学学院人工智能中心) Huawei Noah’s Ark Lab(华为诺亚实验室) UNIST Graduate School of AI(延世大学人工智能研究生院) University of Edinburgh(爱丁堡大学) University of Basel(巴塞尔大学)

AI总结 本文提出MT-GRPO算法,通过动态调整任务权重和比例保持采样器,提升多任务场景下大语言模型的可靠推理性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏