$Σ$-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
Σ-Mem:面向基于大语言模型(LLM)的多智能体系统的在线可靠性记忆
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 针对现有LLM多智能体系统记忆系统无法建模智能体可信度的问题,提出Σ-Mem在线可靠性记忆,基于决策后反馈更新实对称状态,在Qwen系列模型上实现自适应协调与更优性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
Σ-Mem:面向基于大语言模型(LLM)的多智能体系统的在线可靠性记忆
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 针对现有LLM多智能体系统记忆系统无法建模智能体可信度的问题,提出Σ-Mem在线可靠性记忆,基于决策后反馈更新实对称状态,在Qwen系列模型上实现自适应协调与更优性能。
IFCMemoryBench:评估基于大语言模型(LLM)的智能体在建筑信息模型(BIM)信息检索中的长期记忆能力
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 本文推出IFCMemoryBench基准,评估基于LLM的智能体在BIM信息检索中的长期记忆,发现现有通用记忆系统在该场景下表现差,存在领域迁移差距。
Comments KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI
全景监控:基于个人身份信息的自然主义输出令牌集合,用于研究大语言模型上下文窗口内的隐私泄露
机构 * Meta
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型上下文窗口内隐私泄露问题,引入PANOPTICON管道和数据集,由Meta模型生成含PII片段的提示,测量数据集多样性评估真实性,通过案例展示其在理解提示反转攻击中的效用及为LLM隐私研究奠基。
Comments 9 pages, 3 figures, 3 tables. Submitted to IEEE CARS 2026
基于基于检索增强生成的记忆和多模态教练代理的端到端大语言模型飞行规划
机构 * George Washington University(乔治华盛顿大学) ; Metis Solutions Technology Inc
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对电动垂直起降飞机部署中传统飞行规划算法难以融入人类偏好的问题,提出FRAMe工具,集成规划器LLM、多模态教练代理和基于RAG的记忆,在多场景演示中效果最佳,能将自然语言指令转化为优质飞行路线。
Comments Accepted at the ICML 2026 LM4Plan Workshop
DeadPool: 通过零开销检查点热替换实现弹性LLM训练
机构 * Rutgers University(罗格斯大学) ; George Mason University(乔治·马歇尔大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出DeadPool,利用非关键路径内存检查点和通信器重建协议实现零开销热替换,在无故障时无额外开销,故障时40秒内恢复,支持高达512 GPU和65B参数模型。
重新思考LLM集成应用的复杂性度量:超越源代码
机构 * Zihao Xu1, Yuekang Li1, Gelei Deng2, Yi Liu3, Zhenchang Xing45(未明确机构)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出HECATE工具,基于Prompt-as-Specification形式化方法,从提示层和代码层评估LLM集成应用的复杂性,发现提示层复杂性是独立维度,10个有效度量中7个为新增的结构广度度量。
Agri-SAGE:基于模拟的多智能体LLM用于上下文感知的农业咨询生成
机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) ; BNM Institute of Technology, Bengaluru(BNM理工学院,班加罗尔)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出Agri-SAGE框架,结合检索增强的多智能体LLM推理与APSIM生物物理模拟,生成并验证农艺建议;通过十年回顾分析,三种推理方法均优于静态基线,其中思维树实现最高产量,反思法以较低计算成本达到相当效果。
可对话的复杂性:作为可解释基质的智能体LLM集体
机构 * IT University of Copenhagen(哥本哈根信息技术大学) ; University of Oslo(奥斯陆大学) ; Østfold University of Applied Sciences(东福尔应用科学大学) ; Sakana AI
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出将智能体大语言模型集体作为人工生命研究的计算基质,利用自然语言通信实现可解释性,并综述了相关实例。
超越困惑度:面向LLM测试时训练中部署记忆声称的行为评估框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出行为评估框架,通过证据阶梯和显式记忆基线校准LLM测试时训练的记忆声称,揭示代理指标与部署行为之间的差距。
SeKV:面向长上下文LLM推理的分辨率自适应KV缓存与层次化语义记忆
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Microsoft Research(微软研究院)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出SeKV,一种分辨率自适应的语义KV缓存方法,通过熵引导的语义片段和GPU-CPU层次化存储,在不丢弃信息的情况下实现按需token级重建,平均性能提升5.9%,GPU内存减少53.3%。
TRUSTMEM:学习具有长期记忆的LLM智能体的可信记忆巩固
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心) ; University of Notre Dame(圣母大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出TrustMem框架,通过记忆转换验证器评估更新过程,并利用偏好强化学习优化记忆更新行为,显著提升记忆效用和可靠性。
面向多智能体LLM系统的受控共享内存
机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 本文形式化多智能体LLM系统的舰队内存问题,提出四种故障模式,并设计显式系统级原语(范围检索、时间替代、溯源追踪、策略控制传播)在MemClaw中实现,通过ArgusFleet评估,发现长上下文检索不足以满足生产需求。
自进化LLM智能体系统中的安全性:威胁、放大与案例研究
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Fudan University(复旦大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 本文系统分析自进化LLM智能体系统的安全威胁,提出模块-生命周期攻击面矩阵,揭示17个关键威胁和7种跨模块放大效应,并通过案例证明进化设计激活3.5倍攻击面且静态防御失效。
治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。
LLM即代码:面向Agent框架的编程范式
机构 * City University of Hong Kong(香港城市大学) ; Tencent Jarvis Lab(腾讯贾维斯实验室)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 针对LLM作为编排器导致控制流幻觉和不可靠执行的问题,提出Agentic Programming范式,由程序控制所有流程,LLM仅作为代码组件在需要推理或生成时被调用,显著提升长序列操作的稳定性。
Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)
EvoArena: 追踪记忆演化以构建动态环境中的鲁棒LLM智能体
机构 * National University of Singapore(新加坡国立大学) ; Singapore Management University(新加坡管理大学) ; University of Washington(华盛顿大学) ; University College London(伦敦大学学院) ; University of Pennsylvania(宾夕法尼亚大学) ; Nanyang Technological University(南洋理工大学) ; Recursive ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出EvoArena基准套件模拟终端、软件和社交领域的渐进环境变化,并设计基于补丁的记忆范式EvoMem记录结构化更新历史,使智能体能通过记忆变化推理环境演化,实验表明当前智能体在动态环境中表现不佳,EvoMem可稳定提升性能。
基于知识的无重放多智能体LLM轨迹调试
机构 * ustechlab.com(ustechlab)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种知识图谱驱动的无重放预测方法,通过结构化事件知识图谱和轻量级预测器,在不执行重放的情况下定位高影响事件,将轨迹定位召回率从0.73提升至0.93。
Comments 21 pages, 1 figure, 6 tables. Submitted to Knowledge-Based Systems
当错误成为叙事:生产级LLM Agent运行时中静默故障的纵向分类
机构 * Independent researcher(独立研究者)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 通过八周对生产级个人助手Agent运行时的研究,识别出28次静默故障,提出五类机制导向分类,其中D类(链式幻觉与捏造)为LLM特有且最危险,系统会生成流畅可信的虚假叙事。
Comments 18 pages, 5 figures, 2 tables. 22 incident postmortems and all defense-framework artifacts publicly available at https://github.com/bisdom-cell/openclaw-model-bridge; governance engine on PyPI (openclaw-ontology-engine)
tap:一种用于异构LLM智能体协作的基于文件的协议
机构 * HUA Labs(HUA实验室)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出tap协议,通过文件优先设计实现不同厂商LLM智能体(如Claude和Codex)在共享代码库上的协作,无需共享内存或相同运行时,实验表明异构模型对审查缺陷发现率更高。
Comments Accepted to KCC 2026. English archival translation. 3 pages, 1 figure, 3 tables
ActiveMem: 用于长程LLM推理的分布式主动记忆
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ActiveMem框架,将记忆从核心推理中解耦,通过分布式主动记忆系统积累语义要点,在长程推理任务中实现高精度和低开销。
保护LLM智能体长期记忆免受投毒:具有机器验证保证的不可延展、源绑定权限
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 针对LLM智能体长期记忆投毒攻击,提出不可延展信息流控制(IFC)方案TMA-NM,通过源绑定和防Sybil确认门控实现0%攻击成功率。
Comments Index Terms: LLM agents, long-term memory, memory poisoning, information-flow control, capability security, prompt injection, formal verification, benchmark
EvoPINN:面向物理信息神经网络可执行算法的智能体式发现框架
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 EvoPINN是智能体式框架,将PINN开发转化为基于执行的算法发现,通过LLM智能体迭代优化,自主发明SLRC-PINN,可显著降低PDE求解的相对L₂误差,为科学计算提供新机制。
使用自然语言处理比较人类和大语言模型中的语义导航
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过语言流畅性数据,运用基于轨迹的自然语言处理指标,比较人类与三个大语言模型的语义搜索动态,量化相关维度,发现人类语义搜索在局部利用和全局探索间有独特平衡,当前模型架构无法重现。
Comments Cogsci paper 2026
Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 48(0), 2026
MemTrapBench:大语言模型记忆使用中认知陷阱的基准测试
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究人员提出MemTrapBench基准测试,发现现有LLM记忆策略存在认知陷阱致性能下降,进而提出AdaptiveMem方法可缓解该问题并提升标准记忆基准性能。
Comments Work in progress
用于语音识别的缓存大语言模型概率检索
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM直接重评分ASR假设成本高的问题,本文提出无需训练的缓存LLM概率检索方法,在多数设置下优于1-pass ASR,是轻量有效的ASR适配方案。
Comments under review
采用高带宽ReRAM近内存架构的分散式大语言模型(LLM)服务中的MoE专家执行
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 本文针对分散式LLM服务中MoE专家执行的资源效率问题,提出ReRAM近内存架构,通过优化池化、放置与取数策略提升资源占用率,在实测中大幅降低延迟与能耗。
用于LLM推理中可扩展KV缓存管理的光子-CXL存储设备
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 该研究针对LLM推理的存储墙问题,提出Marvell光子-CXL混合存储设备,实现32 TB共享内存,延迟降超50%,多轮对话首token时间提升6.6倍,解决了电气CXL池的部署痛点。
AgentTether:用于可靠大语言模型代理操作的图引导诊断与运行时干预
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究LLM代理生产可靠性有限问题,提出AgentTether运行时修复框架,通过抽象运行、构建关键转换图等定位故障子轨迹并转换为指导,经实验评估,该框架能提高修复效果,减少资源消耗,为代理部署提供实用可靠性层。
EconSimulacra:基于LLM代理的社会经济系统数字孪生平台
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出EconSimulacra,一种通过共享内部状态机制耦合消费经济、移动性和社交网络的多智能体模拟器,使代理能产生跨领域一致行为,并复现线上关注与线下流行度的非线性关系。
ESAA-Conversational:一种用于异构LLM编码智能体之间连续性、交接和策管的事件溯源记忆层
专题命中 长上下文与记忆 :LLM(title,title_cn)
AI总结 提出ESAA-Conversational架构,通过事件溯源实现跨多个LLM编码智能体的共享会话记忆,解决会话状态漂移问题,支持连续性、交接和策管。
Comments 11 pages, 1 table