When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHF
当人类偏好翻转时:面向RLHF的实例依赖性鲁棒损失
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出了一种面向RLHF的实例依赖性鲁棒损失算法,通过建模偏好翻转机制和引入实例依赖的翻转概率,提升对齐算法的鲁棒性。
Comments Accepted by AAAI-26-AIA