Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
通过在线细化增强强化学习微调
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出动态约束机制,通过在线细化模型提升强化学习微调的稳定性与性能,在对话和代码生成任务中优于KL正则化和无约束基线。