Katja Grace, Harlan Stewart, Julia Fabienne Sandkühler, Stephen Thomas, Ben Weinstein-Raun, Jan Brauner, Richard C. Korzekwa
机构
*
AI Impacts
;
Berkeley, California United States(伯克利加州大学)
;
Department of Psychology University of Bonn(波恩大学心理学系)
;
University of Bonn(波恩大学)
;
Department of Computer Science University of Oxford(牛津大学计算机科学系)
;
University of Oxford(牛津大学)
;
Independent(独立研究者)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
CommentsThe asterisk indicates the corresponding author. The dagger indicates equal contribution
Journal refJournal of Artificial Intelligence Research 84:9 (2025)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
Jason Bohne, Pawel Polak, David Rosenberg, Brian Bloniarz, Gary Kazantsev
机构
*
Department of Applied Mathematics and Statistics(应用数学与统计学系)
;
Stony Brook University(石溪大学)
;
Institute for Advanced Computational Science(先进计算科学研究所)
;
Center of Excellence in Wireless and Information Technology (CEWIT)(无线与信息技术卓越中心)
;
AI Innovation Institute(人工智能创新研究院)
;
Bloomberg(彭博)
;
Toronto, ON M5J 2S1(多伦多,ON M5J 2S1)
;
San Francisco, CA 94105(旧金山,CA 94105)
;
Bloomberg New York, NY 10022(纽约,NY 10022)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)