Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
大语言模型家族中的跨模型KV缓存迁移:用于预填充复用的闭式线性映射
专题命中 长上下文与记忆 :LLM(title);分类 cs.LG
AI总结 针对大语言模型家族切换时需重新预填充的问题,提出跨模型KV缓存迁移方法,通过闭式线性映射器复用源模型KV缓存,可提升预填充速度,保留大部分准确率,具备实用性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
大语言模型家族中的跨模型KV缓存迁移:用于预填充复用的闭式线性映射
专题命中 长上下文与记忆 :LLM(title);分类 cs.LG
AI总结 针对大语言模型家族切换时需重新预填充的问题,提出跨模型KV缓存迁移方法,通过闭式线性映射器复用源模型KV缓存,可提升预填充速度,保留大部分准确率,具备实用性。
从认知架构到语言智能体:谱系、融合与迁移差距的机制层面综述
专题命中 长上下文与记忆 :language agent(title);分类 cs.AI
AI总结 该综述连接多个认知架构与语言智能体系统,重构机制并编码相关关系,指出现代智能体部分功能已实现,最强机会在机制耦合,存在五个剩余组合,贡献了机制目录、证据深度框架及可证伪议程。
Comments 28 pages, 9 figures, 14 tables. Review article
时间上下文恢复驱动长上下文语言模型中的情景式顺序记忆
专题命中 长上下文与记忆 :language model(title);分类 cs.AI
AI总结 研究长上下文语言模型中情景式顺序记忆的机制,通过时间顺序记忆任务及新数据集,发现模型呈现与人类相同的距离效应,且性能依赖一维时间编码,由单个注意力头在检索时恢复,支持时间上下文恢复是重要机制。
SWE-Pruner Pro:编码语言模型已知道该修剪什么
专题命中 长上下文与记忆 :LLM(title);分类 cs.CL
AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。
Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro
MemPoison:揭示大语言模型智能体中持久内存威胁和结构盲点
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; NARI Group Corporation/State Grid Electric Power Research Institute, China(国网电力研究院/国电电力集团)
专题命中 长上下文与记忆 :LLM(title);分类 cs.AI
AI总结 研究大语言模型智能体持久内存安全漏洞,提出MemPoison框架,含1227个案例,涵盖多种攻击类型等并评估多个模型系列。引入分类法,揭示防御边界及盲点,主张转向自适应、上下文敏感的内存防御策略。
从静态到动态:基于MCR-Bench的真实世界代码审查基准测试
机构 * Sun Yat-sen University(中山大学) ; Chongqing University(重庆大学) ; Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出首个面向真实多轮代码审查的缺陷状态感知基准MCR-Bench,通过实验发现主流LLMs在该任务中存在整体能力有限、缺陷敏感性性能差异大及存在跨轮次时间错位等失效机制的问题。
Comments Accepted at ISSTA 2026
JIT-Agent:通过即时测试框架演进扩展测试框架智能
机构 * LV-NUS Lab(LV-NUS实验室)
专题命中 长上下文与记忆 :LLM(abstract_cn);foundation model(abstract);分类 cs.CL、cs.LG
AI总结 JIT-Agent是首个专为即时生成智能体测试框架设计的模型,可定制、修复、自我演进测试框架,提升DeepSeek、GLM等模型在多基准任务的性能,确立测试框架智能为智能体能力的独立可扩展维度。
阅读并非使用:检索、判断与AI金融研究工作流的设计
机构 * Carroll School of Management, Boston College(波士顿学院卡罗尔管理学院) ; Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对长上下文金融分析中存在的检索-整合缺口,通过实验发现工作流架构会影响LLMs将检索到的风险披露信息整合至投资判断的效果,指出AI分析师表现由模型能力与工作流架构共同决定。
Prime Agent:一种自改进的RLM管控框架
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Prime Intellect
专题命中 长上下文与记忆 :language model(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 Prime Agent是一款开源RLM管控框架,通过标准化流程提升模型长周期能力,在ARC-AGI-3等任务中大幅提升性能,支持编码等工作流与并行化任务。
Comments 16 pages, 10 figures. Technical report. Code: https://github.com/PrimeIntellect-ai/prime-agent
DiaRelay:使用固定大小内存传递对话上下文以实现对话中的情感识别
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出基于LoRA的轻量适配器DiaRelay,通过新增两个内存组件解决现有ERC方法的局限,在MELD、IEMOCAP数据集上取得良好效果,验证了其有效性与通用性。
用于Muon优化器的物理响应-记忆模型
机构 * School of Physics Science and Engineering, Tongji University(同济大学物理科学与工程学院)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文构建训练权重矩阵的物理响应-记忆模型,解释Muon优化器半正交化方向的有效性,提出Bi-Maxwell优化器,其双时间尺度记忆核可减少大型语言模型训练步数。
Comments 44 pages, 8 figures
MemFuse:基于碎片化观测的多源记忆融合
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对现有记忆系统多聚焦单源文本、无法处理碎片化信息的问题,提出多源记忆融合基准MemFuseBench与结构化记忆系统MemFuse,实验显示MemFuse在跨源证据融合任务上表现最优。
Comments 30 pages, 4 figures, 4 tables
当上下文产生误导时:用于稳健检索增强生成的意图引导解码
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对现有RAG系统固定信任策略的缺陷,提出意图引导解码(IGD)框架,经多基准评估,可显著提升事实恢复能力,同时保持或改善上下文遵循行为。
AutoMem:面向自动化记忆架构搜索的文本梯度递归自改进框架
机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 AutoMem是面向任务自适应记忆架构搜索的文本梯度递归自改进框架,通过经验引导架构搜索与失败引导模块诊断,在多基准测试中性能优于人工设计基线,实现了准确率与效率的良好权衡。
在压缩中迷失:评估上下文压缩下的侧约束损失
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文针对长上下文场景下压缩器丢失会话约束(SCs)的问题,提出COMPINT评估套件量化损失,并开发即插即用的SCs感知提取器,使SCs保留率超90%。
保持简洁:用于超长视频理解的多键情景记忆检索
机构 * Yonsei University(延世大学) ; Adobe Research(奥多比研究院)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。
Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/
AI智能体签名工作流的硬件密钥存储:零信任MCP实施架构
机构 * Huawei Technologies(华为技术有限公司) ; EPITA(巴黎高等信息技术与应用科学学院)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对AI智能体私钥易泄露问题,提出基于硬件密钥存储与五层零信任栈的架构,实验显示其攻击成功率降为0%且无误报。
Comments 11 pages, 2 figures. Accompanying code and artifacts available at: https://anonymous.4open.science/r/Hardware-Keystores-for-AI-Agent-Signing-Workflows-Artifact-357C
QEvict:面向注意力漂移鲁棒长上下文解码的可恢复量化键值缓存驱逐机制
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 QEvict是一种三层KV缓存管理方案,通过可恢复量化驱逐解决长上下文解码中的注意力漂移问题,在固定内存预算下提升了长上下文任务的信息保留效果。
Comments 24 pages, 6 figures. The first four authors contributed equally
用上下文感知语义嵌入增强表格学习器
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出CASE框架,结合LLMs语义理解与表格学习器统计能力,通过预填充Gemma 3表格语言模型KV缓存建立语义锚点,在CARTE等基准上显著提升表格学习器在语义丰富数据集的低数据场景性能。
PI-Mem:通过并行迭代式记忆将长上下文推理推向360万 tokens
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出PI-Mem并行迭代记忆机制,在360万 tokens长上下文下,使Qwen系列模型在HotpotQA基准上较循环记忆基线实现准确率提升与推理加速,打破长上下文推理的准确率-效率权衡。
V-Mem:面向多模态智能体长期记忆的模态路由检索
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对多模态智能体记忆的模态与相似性-相关性差距,提出V-Mem系统,通过模态路由检索优化,在Mem-Gallery、LoCoMo数据集上显著提升多模态问答性能。
Comments 19 pages, 2 figures, 16 tables. Code: https://github.com/Dingyi-Kang/V-Mem
MemTxn:智能体记忆中源支持更新与完整状态恢复的事务边界
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型智能体持久内存错误问题,提出MemTxn治理层,通过Ordered PatchTest等组件实现可靠更新与恢复,在多个基准测试中性能优于现有方法。
NVIDIA实验室的OO智能体:原生Python面向对象智能体
机构 * NVIDIA-labs(英伟达实验室)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究提出NOOA这一Python框架构建可靠AI智能体,采用智能体即Python对象的编程模型,结合六个面向模型的理念,证明当前模型能有效使用此接口并在相关测试中表现良好,为智能体开发提供新途径。
SALT:用于长上下文压缩的显著性感知词汇字典树
机构 * Florida State University(佛罗里达州立大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型处理长提示时的计算和内存瓶颈,提出SALT框架,将句子关键词组织成按句子频率排序的字典树,通过多锚点检索等方式保留文档主题,降低长上下文提示的预填充成本,还可与KV缓存方法结合。
RoboTTT:机器人策略的上下文扩展
机构 * NVIDIA(英伟达公司) ; Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 长上下文与记忆 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。
Comments Project website: http://research.nvidia.com/labs/gear/robottt/
CatalogAgent:一种由监督者介导的自学习系统,实现生成式人工智能模型的上下文工程
机构 * Amazon(亚马逊)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究电商产品目录结构化属性缺失值预测问题,提出CatalogAgent系统,通过监督者调解冲突、记忆库和汇总器实现自学习,经上下文工程将监督者能力转移到生成器和评估器,有效提升其性能。
PhysMRV:用于物理合理性推理的物理内存检索与验证
专题命中 长上下文与记忆 :language model(abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。
长上下文语言模型的自引导测试时训练
机构 * Meta AI ; University of Virginia(弗吉尼亚大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对长上下文语言模型处理中单纯扩窗口不能有效利用长输入、准确率易降的问题,提出自引导测试时训练(S-TTT)方法,通过模型识别证据跨度并仅对选定跨度训练,在两个基准上提升了模型准确率。
记住重要时刻:用于长期任务智能体的主动记忆智能体
机构 * Meta AI
专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究长期任务中智能体决策时行为状态衰减问题,提出用主动记忆智能体并行干预,更新记忆库并决定是否提醒。该方法在多个基准测试中提升了智能体性能,消融实验证明其优势,还训练模型实现部分迁移。
从应用层模拟到原生元架构:结构张力作为异构人工智能进化的内生驱动因素
机构 * Shanghai Lixin University of Accounting and Finance(上海立信会计金融大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型无状态需应用层模拟的问题,提出理论框架,引入结构张力、离线循环回路、推理时可塑性三种机制,使模型实例能演化出不同拓扑结构,构成异构智能生态,重新定位治理为架构智能主要标准。
Comments 17 pages, 1 equation, no figures