Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model
Pre-DPO:通过引导参考模型提升直接偏好优化的数据利用
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 Pre-DPO通过引入引导参考模型提升直接偏好优化的数据利用效率,有效提高大语言模型的性能表现。