arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

NVIDIA实测145个Agent Skill:文档检查过关,不等于运行有效

作者:arXivDaily编辑部 arXiv 2608.20614 cs · cs.AI

一个Agent Skill的说明文档格式完整、写得清楚,不代表模型会在真实任务中找到它、按对步骤执行并交付正确结果。NVIDIA提出ACES,把同一任务分别交给“有Skill”和“无Skill”的Agent运行,再计算Skill带来的边际增益。145个真实Skill的静态检查中,94.5%通过默认结构门槛,但结构分与LLM文档评分的Spearman相关系数只有0.14。

实跑部分覆盖58个生产Skill、四种主要Agent运行框架和947组已评分配对案例。综合Skill Lift均值为0.2134,95%配对案例置信区间为0.1967至0.2301;72.8%的配对案例取得正向综合提升。

静态检查能发现问题,但看不到运行失败

ACES保留结构规则、LLM文档评分、代码检查和安全扫描。约50条结构规则覆盖元数据、触发描述、错误处理、脚本存在性和Token开销。论文数据里,86.2%的Skill也能通过LLM文档评分门槛,但两套分数相关性很弱。

论文Figure 1:结构检查与LLM文档评分覆盖不同问题,无法代替真实执行。

静态方法看不到五类常见错误:Agent没有发现Skill、读了却调用错脚本、输出正确但汇报错误、与其他Skill冲突,以及模型升级后执行路径悄然变化。文档没有报警,只说明文件本身满足规则。

同一任务跑两遍,差值才是Skill Lift

每个任务建立配对条件。实验组提供目标Skill,对照组拿掉它,但模型、任务、沙箱、工作区、评分器以及必要的辅助Skill保持一致。两次轨迹统一成ATIF格式,再用六项默认运行指标评分,包括Skill执行、效率、准确率、目标准确率和行为检查。

论文实测:流程类指标与结果类指标对Skill价值给出互补证据。

平均结果增益只看准确率与目标准确率,为0.1799;综合增益更高,是因为Skill执行、行为检查和效率提升更明显。对产品团队而言,结果正确但绕过规定步骤,与按审计流程完成并不是同一种合格。

好模型也会让Skill的边际价值变小

论文分析:固定运行框架后更换模型,绝对分数与Skill边际增益会以不同方向变化。

论文在同一运行框架中切换模型后发现,更强模型可以提高实验组与对照组的绝对成绩,但对照组涨得更快时,Skill Lift会缩小。由此不能只看“用了Skill之后得分更高”,还要问不使用它时模型本来能做到多少。

实跑证据也有边界。64个生产Skill中只有58个形成可评分结果;评测依赖作者提供任务、参考答案、评分器和具体沙箱。不同任务组合、模型版本或可见Skill数量变化后,增益需要重测。

论文把负向Skill Lift也当作调试信号。它可能来自说明过长、触发错误、调用工具绕路,或Skill与更强模型自身策略冲突。只删除负分Skill并不能定位原因,ACES会保留完整轨迹,让作者查看差异发生在发现、执行、行为约束还是最终答案。

评测资产需要与产品目标一起维护。若参考答案过窄,Agent找到另一条正确路径也可能被判错;若只用LLM裁判,版本变化会改变分数尺度。框架因此允许确定性检查、参考答案评分、行为断言和领域自定义评分并存。

下一步把Skill评测接进持续集成

论文热力图:不同Skill在配对运行中的增益分布并不一致。

ACES把评测资产与Skill一起放进仓库,代码或模型变化后可重跑结构、文档、安全和现场任务。NVIDIA已在SkillEvaluator仓库提供方法实现。下一步是让企业任务集覆盖更多失败模式,并处理运行成本:配对测试至少把关键任务执行两遍,还可能调用外部工具与裁判模型。适合先把高风险、高频Skill纳入门禁,再逐步扩大覆盖。

报告中的95%置信区间按配对案例计算,说明平均增益稳定为正,不代表每个Skill都有效。团队还要按业务域查看分布:一个高增益Skill不能抵消另一个会误删文件或泄露数据的Skill,安全门禁与运行增益必须分别通过。

参考资料

https://arxiv.org/abs/2608.20614

https://arxiv.org/html/2608.20614

https://github.com/NVIDIA/SkillEvaluator