From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models
从RLHF到直接对齐:大型语言模型偏好学习的理论统一
机构 * Independent Researchers(独立研究者)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种理论统一框架,将大型语言模型的偏好学习方法归结为三个正交轴上的原则性选择,揭示了不同方法之间的本质联系。