Provably Convergent Primal-Dual DPO for Constrained LLM Alignment
可证明收敛的约束语言模型对齐的对偶直接偏好优化
机构 * SUTD ESD(新加坡科技设计大学电子与计算机工程系) ; UIUC ECE(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系)
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);safety(abstract);分类 cs.LG
AI总结 本文提出了一种可证明收敛的约束LLM对齐方法,通过改进的DPO技术减少训练模型数量和内存消耗,同时保证约束条件和优化性能。