Detecting Prefix Bias in LLM-based Reward Models
机构 * Washington University in St Louis(华盛顿大学圣路易斯分校) ; Meta Platforms, Inc.(Meta平台公司)
专题命中 后训练与偏好优化 :LLM(title,abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * Washington University in St Louis(华盛顿大学圣路易斯分校) ; Meta Platforms, Inc.(Meta平台公司)
专题命中 后训练与偏好优化 :LLM(title,abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; University College London(伦敦大学学院)
专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 27 pages, 9 figures, 5 tables. Accepted to EMNLP 2025
机构 * School of Computer Science and Technology, University of Science and Technology of China(1 计算机科学与技术学院,中国科学技术大学) ; Zhongguancun Academy(2 中关村学院)
专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG
Comments 21 pages