Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
机构 * Amazon(亚马逊)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP Main 2025
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * Amazon(亚马逊)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP Main 2025
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);RLHF(abstract);分类 cs.CL
Comments AAAI 2026 AIA oral, our code is available at https://github.com/Shiroha-Offical/AMaPO
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments 23 pages, 10 figures, AAAI 2026
机构 * Department of Computer Science, University of New Hampshire(新罕布什尔大学计算机科学系) ; Materials Department, University of California, Santa Barbara(加州大学圣芭芭拉分校材料系) ; Department of Mechanical Engineering, University of California, Santa Barbara(加州大学圣芭芭拉分校机械工程系) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL
Comments After further internal discussion, our author team has decided to withdraw this submission due to the need for several important refinements to the manuscript. All co-authors have been informed and agree with this decision
机构 * Cornell University(康奈尔大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of California, Berkeley(加州大学伯克利分校) ; Adobe Research(Adobe研究)
专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract);分类 cs.AI、cs.LG
Comments Accepted to TMLR
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)
专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.CL、cs.LG
Comments Accepted by AAAI 2026