Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game
基于人类反馈的Stackelberg学习:偏好优化作为连续博弈
机构 * ETH Zürich(苏黎世联邦理工学院)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 SLHF通过连续博弈框架实现偏好优化,优于RLHF和NLHF,在一致性、数据敏感性和鲁棒性方面具有优势,并在大规模语言模型中展示出强对齐能力。
Comments 10 pages, 5 tables, 1 figures