智能体先选对一个Skill文件,后续执行却失败,普通结果奖励会连同正确选择一起惩罚。上海交通大学、小红书提出SkillGate,把“选哪个Skill”和“拿Skill完成任务”分成两条互不重叠的信用通道。五项智能体基准上,9B策略的试验成功率从40.8%升至53.2%。
受控对比中,仅使用任务结果奖励的同预算方案为47.0%。SkillGate还把接触误导候选的比例降低约三分之二,并减少平均读取次数。每种训练配置只运行一次,论文用任务级bootstrap估计不确定性,小差异只能作方向性判断。
长轨迹把一次关键选择淹没在数千Token里
Skill通常只有名称和一句描述先暴露给智能体,正文要调用工具后才能看到。测试每道题提供16个候选:一个正确Skill、五个高度相似的诱饵、五个相关旁观项和五个无关项。
团队审计12800条在线训练轨迹,发现Skill名称Token的损失占比中位数只有0.14%,轨迹越长越稀释。正确读取仍能带来11.2个百分点的任务成功差,但约五分之二的正确选择Token收到负优势,因为选择后的执行失败了。
论文Figure 1:选择Token占比随轨迹变长而下降,信用符号更常出错,但正确读取仍显著提高任务成功。
两条奖励通道不能碰到同一个Token
SkillGate删除任务通道中整段读取调用,任务成败只更新推理、代码和其他执行Token。选择通道只覆盖Skill名称Token:单次读取正确Skill得到正效用,读取错误、重复读取或一次读多个文件都不能获益。
论文Figure 2:任务结果只更新执行Token,局部选择优势只更新Skill名称Token,两者在同一次GRPO更新中保持不重叠。
两条通道各自把权重归一到同一批次的基础Token总量,避免几个名称Token再次被长轨迹压低。它没有增加外置路由模型,也不是把正确Skill强制塞给策略;选择仍由9B模型在在线轨迹中自己生成。
五项基准统一放进385次试验
评测覆盖Claw-Eval、SkillsBench、SETA、SWE和Terminal-Bench 2.0,共385次试验,每题最多30轮、850秒。训练使用491项任务,训练与测试的正确Skill身份不重合,降低记住文件名的可能。
53.2%高于同预算结果奖励的47.0%,也高于若干监督选择、偏好学习和外置路由对照。论文同时列出参数大约高40倍的前沿模型作为绝对参考,但这些模型通过供应商API和原生函数调用运行,并非严格受控比较。
论文成本图:不同方法同时比较任务成功、正确Skill读取、诱饵暴露和读取次数。
改进来自信用分配,不是多读资料
消融实验分别去掉选择通道、改变权重或使用独立选择器,检查成功率变化。结果支持关键增益来自把局部选择优势落到名称Token,而不是让模型更频繁地扫描候选。
论文消融图:不同信用掩码和选择设计对任务表现与读取行为的影响。
当前实验每个候选列表只含一个经过验证的正确Skill,真实Skill库可能存在多个可用方案、组合依赖与版本冲突。把“唯一正确名称”扩展到多Skill协作时,局部效用定义需要改变。
下一步是处理数千个Skill与多次读取
SkillGate适合接入软件开发、终端操作和电脑代理训练,让路由决策获得独立监督。后续应扩大候选库,允许一条轨迹按顺序读取多个互补Skill,并测试Skill说明写法变化、过期文件和恶意诱饵。
部署端还要统计路由错误如何传播到外部操作,以及选择通道是否会过度偏好“只读一次”。论文解决了单次Skill选择在长轨迹中拿不到正确信用的问题,复杂工作流的依赖规划仍是下一层任务。
安全评测也不能只看最终成功率:如果错误Skill触发了不可逆外部操作,即使后续轨迹自我修正,代价也已经发生。真实系统需要把选择准确率与权限边界、可撤销性和人工确认点一起设计。
参考资料
https://arxiv.org/abs/2608.18852