Towards a Theoretical Understanding to the Generalization of RLHF
迈向RLHF泛化性的理论理解
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Renmin University of China(中国人民大学)
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG
AI总结 本文通过算法稳定性框架,在线性奖励模型下构建了RLHF下LLM的泛化理论,证明在特征覆盖条件下策略模型的泛化界为O(n^{-1/2}),并推广到梯度方法参数。
Comments 31 pages, 6 figures