Less is More: Improving LLM Alignment via Preference Data Selection
少即是多:通过偏好数据选择改进大语言模型对齐
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Alibaba Cloud Computing(阿里云计算) ; MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学MoE关键实验室)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 通过改进偏好数据选择策略,提升大语言模型对齐效果,实验显示在较少数据下实现显著性能提升。