A Statistical Framework for Alignment with Biased AI Feedback
带有偏见AI反馈的统计框架
机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) ; Department of Electrical and Computer Engineering, Rutgers University(罗格斯大学电气与计算机工程系) ; Department of Statistics, Rutgers University(罗格斯大学统计学系) ; Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG
AI总结 本文提出两种去偏对齐方法,DDPO通过残差修正和密度比重加权提升效率,DIPO直接估计人类偏好概率,实验证明其在情感生成、摘要和对话任务中提升了对齐效率并接近全人类标注数据性能。