智能体每次回答前都要阅读天气、日历、搜索等工具Schema。工具组合或顺序一变,普通前缀缓存就难以复用之前的KV状态。上海交通大学、东方理工学院、西安交通大学提出ReCache,让每份资源独立编码,并只保留调用需要的字段与注意力路径。
在7个公开工具和技能数据集组成的基准上,资源级注意力的调用Inv-F1为82.3%,密集注意力为82.4%;首Token时间提速3.655倍。完整框架将分配的KV张量内存减少92.43%,注意力计算提速1.423倍。
同一工具换个顺序,普通前缀缓存就难复用
语言模型服务通常缓存提示词前缀的键值状态。两次请求若共享完全相同的开头,就不必重新计算。但智能体会根据任务检索不同工具:一次是天气加日历,下一次可能是日历加邮件。内容相同,顺序和组合却不同。
标准自注意力还会让一个工具Schema依赖前面出现的其他工具。天气工具在不同组合中得到的KV表示不再一致,无法直接从缓存拼装。工具越多、说明越长,重复编码成本越明显。
ReCache先为每份资源建立组合不变表示,再按调用贡献选择可见字段。
ReCache将工具、技能和其他可调用描述统一视为资源。目标不是压缩用户问题,而是把反复出现、结构稳定的资源说明从每次请求中拆出来。
局部位置让每份资源独立成块
资源级注意力取消不同资源之间的交叉连接,并给每份资源使用自己的局部位置编号。无论天气工具出现在第1个还是第8个位置,它内部的Token关系保持不变,因此能生成组合不变的KV块。
查询Token仍可查看被选中的资源。模型需要决定调用哪个工具时,会读取工具名、参数和说明;只是各资源在预编码阶段不再互相改写表示。缓存可以按资源标识存储,再根据当前检索结果拼装。
结构剪枝进一步在层、KV头组和字段之间选择贡献较高的路径。语义剪枝保留资源名、参数名、参数说明和必要后缀,删除对调用判断贡献较低的长文本。
论文的效率实验显示,逐步加入选择与剪枝后,KV张量内存显著下降。
剪枝对象是模型推理时的资源表示,不是永久修改原始工具文档。系统仍需保存完整Schema,以便缓存重建、版本更新和调用校验。
调用效果基本持平,首Token明显加快
论文基准汇集7个公开工具与技能使用数据集,并包含资源不重叠测试,检查模型遇到新工具组合时是否仍能调用正确。资源级注意力获得82.3% Inv-F1,密集方案为82.4%,差距0.1个百分点。
首Token时间获得3.655倍加速,说明请求到达后少做了大量重复Schema编码。完整压缩方案把已分配KV张量内存减少92.43%,注意力阶段提速1.423倍。
首Token指标反映资源预编码与缓存复用对请求启动阶段的影响。
不同数字对应不同实验层面,不能把3.655倍写成完整端到端吞吐提升。实际服务还包含检索、网络、工具执行和答案生成,工具调用本身若耗时数秒,模型侧节省的比例会下降。
部署下一步:缓存需要跟随工具版本管理
ReCache适合工具数量多、Schema长且跨请求重复的智能体平台。企业内部Agent经常加载数据库、工单、文档和审批接口,资源级缓存能减少相同说明反复占用显存。
预算分析用于确定压缩程度与工具调用准确率的折中。
部署难点是版本一致性。参数名、必填项或权限说明一旦修改,对应缓存块必须失效;否则模型可能依据旧Schema生成错误调用。资源标识应包含内容摘要和权限上下文,不能只按工具名称复用。
下一步还要测试更长的企业Schema、动态生成工具和多租户权限隔离。论文证明了可复用表示的效率空间,生产系统仍需把缓存命中率、更新频率和错误调用率放在同一套监控中。