Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) ; Stony Brook University(石溪大学) ; Institute for Advanced Computational Science(先进计算科学研究所) ; Center of Excellence in Wireless and Information Technology (CEWIT)(无线与信息技术卓越中心) ; AI Innovation Institute(人工智能创新研究院) ; Bloomberg(彭博) ; Toronto, ON M5J 2S1(多伦多,ON M5J 2S1) ; San Francisco, CA 94105(旧金山,CA 94105) ; Bloomberg New York, NY 10022(纽约,NY 10022)
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG