PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models
PERM:基于心理学的共情奖励建模用于大语言模型
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Huawei Technologies(华为技术)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 PERM通过双向分解和旁观者视角提升大语言模型的共情能力,实验显示其在同理心基准和对话数据集上表现优异,用户偏好率达70%。