TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
TokenRatio: 通过比率匹配实现原理化的token级偏好优化
机构 * National University of Singapore(新加坡国立大学) ; Institute of Cybernetics and Robotics, Czech Technical University in Prague(捷克布拉格技术大学控制论与机器人研究所)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TBPO方法,通过比率匹配恢复token级偏好最优性,改进对齐质量和训练稳定性,并增加输出多样性。