Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training
为什么强化学习比监督微调在泛化能力上更优?一种以数据为中心的视觉语言模型后训练视角
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文通过数据视角揭示了RL在VLM后训练中泛化能力优于SFT的原因,提出DC-SFT方法提升OOD性能并提高稳定性。