GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
机构 * Thrust of Artificial Intelligence, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) ; Zuoyebang Education Technology(佐业邦教育科技) ; Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)
Comments Accepted by NeurIPS 2025