Insights from the Inverse: Reconstructing LLM Training Goals Through Inverse Reinforcement Learning
机构 * Imperial College London(伦敦帝国学院) ; Harvard University(哈佛大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Published as a conference paper at COLM 2025