Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
Uni-DPO:大语言模型动态偏好优化的统一范式
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Xi’an Jiaotong University(西安交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 针对现有DPO方法忽略数据质量和学习难度差异的问题,提出Uni-DPO统一框架,通过自适应重加权偏好对实现更有效的数据利用和更优性能。
Comments Accepted by ICLR 2026. Code & models: https://github.com/pspdada/Uni-DPO