Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
从人类反馈中鲁棒强化学习用于大语言模型微调
机构 * Department of Statistics, LSE(统计系,伦敦经济学院) ; Department of Mathematics, Tsinghua University(数学系,清华大学) ; School of Mathematics, University of Birmingham(数学学院,伯明翰大学) ; Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
AI总结 本文提出了一种鲁棒的强化学习算法,用于改进大语言模型微调中从人类反馈学习奖励函数的性能,通过减少方差和改进后悔界,实验证明其在基准数据集上表现优异。