Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework
超越RLHF和NLHF:在公理框架下的人口比例对齐
机构 * MIT LIDS(麻省理工学院LIDS) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于公理框架的人口比例对齐方法,通过社会选择理论解决传统偏好学习中的偏差和操纵问题,并在推荐任务和语言模型对齐中验证了其有效性。
Comments ICLR 2026