Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model
Pre-DPO:通过引导参考模型提升直接偏好优化的数据利用
专题命中 偏好对齐 :DPO(title,abstract);RLHF(abstract);分类 cs.CL
AI总结 Pre-DPO通过引入引导参考模型提升直接偏好优化的数据利用效率,有效提高大语言模型的性能表现。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
Pre-DPO:通过引导参考模型提升直接偏好优化的数据利用
专题命中 偏好对齐 :DPO(title,abstract);RLHF(abstract);分类 cs.CL
AI总结 Pre-DPO通过引入引导参考模型提升直接偏好优化的数据利用效率,有效提高大语言模型的性能表现。
通过偏好对齐引导跨模态表示
机构 * Apple(苹果公司)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract)
AI总结 MAPLE通过利用多模态大语言模型的细粒度对齐先验,引导跨模态表示学习,提升细粒度检索性能。
Comments Accepted by NeurIPS 2025
ParetoHqD: 利用帕累托高质量数据快速实现大语言模型的多目标对齐
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 ParetoHqD通过利用帕累托高质量数据实现大语言模型的多目标对齐,提升对齐效果和效率。
Comments Accepted as a main conference paper at AAAI 2026
CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成
机构 * National Yang Ming Chiao Tung University
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。
ResponseRank: 通过偏好强度学习实现数据高效的奖励建模
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI总结 ResponseRank通过本地有效相对强度信号稳健学习偏好强度,提升样本效率和鲁棒性,引入Pearson距离相关性度量。
Comments NeurIPS 2025
MUSIC: 多步指令对比用于多轮奖励模型
机构 * Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 MUSIC通过多步指令对比提升多轮奖励模型的性能,有效增强多轮对话的评估能力。