Length-Controlled Margin-Based Preference Optimization without Reference Model
无参考模型的长度可控基于间隔的偏好优化
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) ; International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);RLHF(abstract,abstract_cn);分类 cs.CL
AI总结 本研究针对DPO的局限提出LMPO,引入统一参考模型与平均对数概率优化策略,通过长度可控间隔损失调控响应长度并缓解概率退化,在Mistral和LLaMA3上的6个基准中性能优于现有方法。
Comments 17 pages, 3 figures, 6 tables