Group Causal Policy Optimization for Post-Training Large Language Models
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title);分类 cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title);分类 cs.LG
机构 * Zhejiang University(浙江大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Comments Project Page: https://zju-real.github.io/cooper Code: https://github.com/zju-real/cooper
机构 * Microsoft(微软公司) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Presented at ICML 2025
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
机构 * Tencent AI Lab(腾讯AI实验室)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);SFT(abstract);分类 cs.AI
机构 * Tufa Labs(图法实验室)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 后训练与偏好优化 :post-training(abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 47 pages, 18 figures, authors are listed in alphabetical order by their last names; v3 modifies minor issues