Program Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMs
可验证奖励的程序学习:针对后训练大语言模型的符号反向传播
机构 * CoreThink AI
专题命中 后训练与偏好优化 :post-training(title);language model(abstract);分类 cs.AI
AI总结 本文提出PLVR方法,通过符号反向传播从输入输出示例学习显式程序,在代码基准上提升大语言模型推理能力,边际成本低且效果优于RL。