On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
在SFT的泛化上:从强化学习视角的奖励校正
机构 * Southeast University(东南大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; University of California, Berkeley(加州大学伯克利分校) ; Wuhan University(武汉大学) ; University of California, Merced(加州大学默塞德分校)
AI总结 本文提出动态微调方法,通过奖励校正提升SFT的泛化能力,在多个任务中表现优于传统SFT。
Comments ICLR 2026