Exploring Re-inforcement Learning via Human Feedback under User Heterogeneity
通过用户异质性探索基于人类反馈的强化学习
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract)
AI总结 本研究通过聚类和个性化奖励模型处理用户异质性,提升强化学习模型的胜率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过用户异质性探索基于人类反馈的强化学习
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract)
AI总结 本研究通过聚类和个性化奖励模型处理用户异质性,提升强化学习模型的胜率。
超越正确性:跨文化的主观写作偏好评估
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
AI总结 本文提出WritingPreferenceBench数据集,发现基于序列的奖励模型在评估主观写作偏好时表现不佳,而生成奖励模型通过推理链达到更高准确率,揭示了当前RLHF方法在捕捉主观偏好方面的局限性。