Interpreting Learned Feedback Patterns in Large Language Models
机构 * Luke Marks ; Amir Abdullah ; Clement Neo ; Rauno Arike ; David Krueger ; Philip Torr ; Fazl Barez
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
Comments 19 pages, 8 figures. Accepted to NeurIPS 2024