Interpreting Learned Feedback Patterns in Large Language Models
机构 * Luke Marks ; Amir Abdullah ; Clement Neo ; Rauno Arike ; David Krueger ; Philip Torr ; Fazl Barez
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.LG
Comments 19 pages, 8 figures. Accepted to NeurIPS 2024