Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders
奖励模型中的偏好不稳定性:通过稀疏自编码器进行检测与缓解
机构 * ETH Zürich(苏黎世联邦理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Aalto University(阿alto大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文研究了大型语言模型中奖励模型的偏好不稳定性问题,提出通过稀疏自编码器检测并缓解这种不稳定性,通过隔离不稳定特征来提升模型的偏好准确性。