Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization
通过元权重在线采样对齐:弥合数据生成与偏好优化之间的差距
Junming Yang, Ning Xu, Biao Liu, Shiqi Qiao, Xin Geng
机构
*
School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院)
;
Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
RE-PO:一种用于大语言模型对齐的鲁棒增强策略优化通用框架
Xiaoyang Cao, Zelai Xu, Mo Guang, Kaiwen Long, Michiel A. Bakker, Yu Wang, Chao Yu
机构
*
IDSS, Massachusetts Institute of Technology(IDSS,麻省理工学院)
;
EE, Tsinghua University(电子工程系,清华大学)
;
Li Auto Inc.(力汽车公司)
;
SIGS, Tsinghua University(系统工程系,清华大学)
专题命中
后训练与偏好优化
:LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)
机构
*
Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队)
;
Beijing University Of Posts and Telecommunications(北京邮电大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)