智能体执行长任务时,聊天记录越来越长,未完成目标容易被淹没,检索到的技能也可能与当前状态错位。新加坡国立大学、斯坦福大学、牛津大学、普林斯顿大学提出Recuris,把工作记忆和经验记忆耦合,并让失败证据反向推动局部技能更新。
论文覆盖4个长任务基准和10个模型。37个完成的模型—基准组合中,35个成功率上升;在τ2-Retail上,GPT-5.6 Sol提升17.8个百分点,Claude Opus 5提升15.6点至87.9%。两个未完成组合不计入35/37。
先把当前任务状态从长历史里单独拿出来
普通经验记忆系统会根据整段对话检索技能。上下文拉长后,早期目标和后期工具结果混在一起,智能体可能忘掉尚未完成的写操作,或者调用只适合相似表面文本的旧技能。Recuris用工作记忆持续记录目标、状态和已验证进展。
论文Figure 2:传统系统依赖长历史和静态检索,Recuris用工作状态约束技能调用,并按结构化轨迹局部更新。
每次选技能时,策略读取当前工作状态,再从经验记忆中找对应方法。工具执行结果经过检查器验证后才写回工作记忆。这样,“已经向用户确认”不会被误当成“已经完成工具写入”。
执行轨迹变成可定位的失败证据
一次任务执行会记录工作记忆、调用的经验技能、动作和观察。若结果失败,系统可以追到是状态没更新、技能内容错误、调用策略错位,还是工具执行异常。元智能体只修改被证据指向的组件,并通过固定开发集门槛决定是否接受更新。
论文Figure 3:任务内循环维护工作记忆并调用经验技能,跨任务循环根据失败轨迹修改技能记忆。
这种递归更新是有界的:基础模型不变,元智能体不变,更新只能进入技能记忆,并且每次都要通过验证。它不是让模型自由改写自身权重,也不是无限迭代到指标变好为止。
长任务越长,状态耦合带来的差距越大
在τ2-Retail、τ2-Airline、SkillFlow和Terminal-Bench等任务上,Recuris对工具对话、技能复用和终端操作分别评估。论文把任务按交互长度分组,最长组的平均提升达到32.2个百分点,常见长任务失败最多减少80%。
部署模型Doubao-2.0-Pro生成的记忆包还能迁移到未参与演化的前沿模型。τ2-Retail上,GPT-5.6 Sol由58.3%升至76.1%,Claude Opus 5由72.4%升至87.9%。这种迁移依赖任务族共享结构,不表示任意领域记忆都能直接复用。
论文案例图:工作记忆保留多个未完成目标,避免智能体在口头确认后漏掉必要工具写入。
局部修改比整包重写更容易审计
消融实验显示,只加工作记忆、只检索经验技能或只做结果驱动更新,都不如两类记忆耦合。结构化轨迹还能把错误归到具体组件,使更新前后的差别可以逐条检查。
论文案例图:失败轨迹暴露具体技能交换错误,元智能体只修改相关记忆条目并重新验证。
实验中的平均四次尝试预算也会抬高最终成功率。论文专门分解Terminal-Bench结果,说明重试预算承担了部分提升;记忆机制的作用需要在相同预算下比较,不能把全部差距都归因于递归演化。
下一步是把记忆更新纳入生产审计
对客服、办公和终端智能体,局部技能更新比修改基础模型更容易回滚,也便于记录“哪条失败证据触发了哪项改变”。进入生产后,还需对跨用户数据隔离、错误记忆传播和验证集过拟合设置更严格门槛。
代码已经公开。后续应在全新任务族、长期连续运行和固定成本预算下复现35/37结果,并测量记忆库增长后的检索延迟。若任务结构变化过快,旧经验可能从帮助变成干扰,系统还需要可靠的淘汰与版本机制。
参考资料
https://arxiv.org/abs/2608.24876