Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment
基于对齐的DPO:一种原则性的推理方法以提高安全性对齐
机构 * University of Virginia(弗吉尼亚大学) ; Capital One
专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);safety(title,abstract);RLHF(abstract)
AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。