Leash: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model
Leash:自适应长度惩罚与奖励塑造用于高效大推理模型
机构 * Peking University(北京大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Leash通过自适应长度惩罚与奖励塑造,有效提升大模型推理效率,减少推理长度60%同时保持性能竞争力。