普林斯顿大学、卡内基梅隆大学、多伦多大学、伊利诺伊大学厄巴纳-香槟分校、斯坦福大学和牛津大学团队提出“技能熵”,专门衡量大模型在一条推理链中从一种技能切换到另一种技能的难度。
团队用558种技能构建Skill²-Bench,覆盖九个领域。加入技能熵奖励后,Qwen3-4B-Instruct得分从34.4%升到68.4%,Qwen3-1.7B从14.6%升到40.1%。
论文图1:技能熵既用于给跨技能任务分级,也作为强化学习奖励监督模型的技能切换。
单项都会,连起来仍会掉分
跨技能任务要求前一步输出成为后一步输入。例如先做数学推导,再用结果安排日程,随后从文档中提取信息。模型不能把每一步当成彼此独立的问答,也不能沿用上一题的答案格式。
基准包含数学、科学、编程、逻辑、信息抽取、规划、创意写作、上下文检索和指令遵循。任务长度为2到10步,相邻步骤来自不同领域。八个前沿模型和四个开源模型在技能熵更高的任务上,准确率整体下降。
论文表1:六个领域使用可验证答案,三个开放式领域使用生成的评分规则和大模型裁判。
同一种技能放进跨技能链后,相比单技能问题会下降4%到13%。主要错误发生在后续步骤:模型沿用前一步的技能和回答形式,而没有切换到当前步骤需要的方法。
奖励模型“选对解题方式”
技能熵比较某项技能单独出现与接在另一项技能之后时的准确率。方向也很重要:从规划切到信息抽取的难度,可能不同于反向切换。团队用固定参考模型估计成对分数,再把整条任务里的多次切换取平均。
Skill-Entropy RL要求模型每一步先预测所用技能,再给答案。奖励同时检查步骤正确性,以及预测技能序列与标准技能链是否一致。模型因此不只学习最终答案,也被明确训练何时改变推理方式。
论文图3:基础模型第二步继续给出数学式短答,训练后会切换到主题创作并改变回答形式。
论文图4:在OpenR1-Math训练中,普通GRPO趋于平台后,技能熵奖励仍继续提高回报。
分数翻倍依赖自建任务分布
Skill²-Bench把已有问题由模型重写成连续情境,再通过验证器筛选。三个开放式领域的题目和评分规则由模型生成,结果依赖大模型裁判;参考模型一旦变化,技能熵的绝对值也可能改变。
论文还在OpenR1-Math上测试通用性,相比普通GRPO平均提高1.9个百分点,幅度远小于自建基准上的翻倍。当前结果说明显式技能切换监督值得研究,但不能直接推断真实编码、研究或旅行代理的端到端成功率也会翻倍。