Intelligently Weighting Multiple Reference Models for Direct Preference Optimization of LLMs
智能加权多个参考模型以直接优化大语言模型的偏好
机构 * Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出四种新的加权策略以优化大语言模型的偏好,发现单参考DPO在多数情况下优于多参考方法。
Comments Working paper. 13 pages, 4 figures