Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
大语言模型奖励学习中异质人类反馈的不确定性量化
机构 * Department of Biostatistics, Yale University(耶鲁大学生物统计学系) ; Department of Biostatistics, Harvard University(哈佛大学生物统计学系) ; Department of Quantitative Methods, Purdue University(普渡大学定量方法系)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
AI总结 本文提出了一种异质偏好框架,通过双凸优化解决大语言模型奖励学习中的不确定性量化问题,并通过理论保证和实验证明其有效性。