Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
开篇即胜,半途而废:基于前缀优化的强化学习用于大语言模型推理
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 PPPO通过优化LLM推理的前缀部分,提升推理能力,实验显示其在推理任务中表现更优。
Comments Accepted by AAAI 2026