The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
优化训练策略的幻象:单调推理策略作为大语言模型强化学习的真正目标
机构 * Tianjin University(天津大学) ; Alibaba(阿里巴巴)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 针对LLM强化学习中训练-推理概率不一致导致的策略不稳定问题,提出单调推理策略改进(MIPI)目标及两阶段框架MIPU,通过推理侧间隙代理选择候选更新,提升推理性能与训练稳定性。