从记忆到技能:基于证据的长期大语言模型智能体协同进化治理
From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents
- University of Science and Technology of China(中国科学技术大学)
- Hong Kong Polytechnic University(香港理工大学)
- Fuzhou University(福州大学)
- Xi’an Jiaotong University(西安交通大学)
机构由 AI 辅助整理,请以论文原文为准。
AI总结:
针对长期大语言模型智能体记忆系统问题,提出无需训练的MSCE框架,将经验组织为多种形式,把证据支持的策略转化为可调用技能,引入反射加权值回填,实验证明其性能优于基线,有跨域转移性和终身进化能力。
AI中文摘要:
现有的长期大语言模型智能体记忆系统通常将先前痕迹作为被动上下文检索,而非转化为可执行能力。本文提出MSCE,一个无需训练的记忆-技能协同进化框架,将智能体经验组织为有根据的步骤痕迹、可复用的程序策略和声明性环境认知。MSCE将具有正估计增益的证据支持的二级策略结晶为可调用技能,保留证据链接、适用边界等。还引入反射加权值回填,通过密集局部自反射传播稀疏终端反馈,以产生用于治理记忆和技能进化的证据校准痕迹值。在EvoAgentBench和LoCoMo上的实验表明,MSCE显著优于现有技术的技能增强和记忆驱动智能体基线,具有强大的跨域可转移性和终身进化能力。
英文摘要:
Existing memory systems for long-horizon LLM agents often retrieve prior traces as passive context rather than converting them into executable capabilities. In this paper, we propose MSCE, a training-free Memory--Skill Co-Evolution framework that organizes agent experience into grounded step traces, reusable procedural policies, and declarative environmental cognition. MSCE crystallizes evidence-backed L2 policies with positive estimated gain into callable skills that retain evidence links, applicability boundaries, decision guidance, verification rules, and reliability estimates. It further introduces reflection-weighted value backfilling, which propagates sparse terminal feedback through dense local self-reflections to produce evidence-calibrated trace values for governing memory and skill evolution. Experiments on EvoAgentBench and LoCoMo demonstrate that MSCE significantly outperforms state-of-the-art skill-augmented and memory-driven agent baselines, exhibiting strong cross-domain transferability and lifelong-evolution capabilities.