ORBIT: On-policy Exploration-Exploitation for Controllable Multi-Budget Reasoning
ORBIT:可控多预算推理的在线探索-利用
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; LLM Department, Tencent(腾讯LLM部门) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 ORBIT提出可控多预算推理框架,通过多阶段强化学习发现帕累托最优推理行为,并通过在线蒸馏融合行为,实现可控推理行为、高推理密度和统一模型集成。
Comments Preprint