GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning
GRIP:用于高效推理的粒度奖励引导参数插值
机构 * Peking University(北京大学) ; Xi’an Jiaotong University(西安交通大学)
AI总结 针对推理模型与指令模型的准确性-效率不匹配问题,提出GRIP框架,通过优化同架构两模型模块的可学习插值比例,实现更优的准确性-效率权衡。
Comments 13 pages, 8 figures