From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models
从RLHF到直接对齐:大型语言模型偏好学习的理论统一
机构 * Independent Researchers(独立研究者)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);preference optimization(abstract)
AI总结 本文提出了一种理论统一框架,将大型语言模型的偏好学习方法归结为三个正交轴上的原则性选择,揭示了不同方法之间的本质联系。