Distributionally Robust Listwise Preference Optimization
分布鲁棒列表偏好优化
机构 * The University of Hong Kong(香港大学) ; Yale University(耶鲁大学) ; Purdue University(普渡大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对列表偏好排序标签不确定性,提出点态全变差鲁棒Plackett-Luce目标,将内层最大化简化为排序,在离线和在线设置中均具有理论保证,实验表明能保持干净标签性能并提升噪声鲁棒性。