Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
Comments 9 pages, 2 figures
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
Comments EMNLP Findings 2024
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
Comments A rethinking of Short Shifted Attention
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL
智能体记忆蒸馏:用分层教师记忆赋能小型大语言模型智能体
机构 * KAIST(韩国科学技术院)
专题命中 长上下文与记忆 :LLM(title);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出无需训练的Agent Memory Distillation框架,通过从大型教师智能体构建三类分层记忆迁移知识,提升小型大语言模型智能体的工具使用性能,在三个基准上实现显著准确率提升且优于现有基线。
Comments Under review
DREAM:基于大语言模型的事件感知记忆图动态角色扮演
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Computer Science, Fudan University(复旦大学计算机科学技术学院)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 DREAM是一种受ABC认知模型启发的结构化记忆框架,通过EMG提升角色扮演智能体的时间与因果连贯性,在CoSER、LIFECHOICE和TCM上取得最优性能。
Comments Accepted at KDD 2026. Camera-ready version to appear. 16 pages, 5 figures
MemSIF:从结构化交互到面向大语言模型智能体的双轨事实记忆
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大语言模型智能体的长期记忆问题,提出MemSIF框架,通过结构化交互记忆与双轨事实记忆缓解两种错位模式,在两个数据集上的五种主干模型中均取得最高总准确率。
Comments Submitted to AAAI 2027. 19 pages, 10 figures, 18 tables
策略滞后下的回滚复用:面向大语言模型强化学习的前缀归一化策略优化
机构 * Tencent(腾讯) ; Harbin Institute of Technology(哈尔滨工业大学) ; Jinan University(暨南大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型强化学习中回滚复用导致的离策略问题,提出前缀归一化策略优化(PNPO),在4个更新周期时其数学推理性能优于GSPO,可降低更新批次需求。
ForgetBench:语言模型中长期参数记忆的遗忘动态基准测试
专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出ForgetBench基准测试,通过两种评估范式与统一分析框架,揭示现有LLMs在长期知识保留与泛化间难以平衡的问题,为未来模型记忆机制优化提供方向。
Comments 9 pages, 4 figures
情感如何在大语言模型智能体之间传播:人群模拟中的涌现情感传染
机构 * University of Massachusetts(马萨诸塞大学)
专题命中 长上下文与记忆 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究多智能体人群模拟中情感传播,通过感知 - 评估 - 表达循环及借鉴相关模型构建架构,在多场景评估,揭示情感传染动态,包括警报扩散、个性影响等,还发现评估步骤动态依赖后端。
Comments 31 pages, 14 figures
HiKV:用于大语言模型解码的具有硬件加速的分层重要性感知键值缓存
机构 * ESAT-MICAS, KU Leuven(KU莱顿大学ESAT-MICAS)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对长上下文大语言模型解码时键值缓存的内存瓶颈,HiKV提出算法-硬件协同设计,通过分层重要性感知在两粒度压缩缓存,开发专用加速器统一两阶段加速,在大语言模型上评估实现加速、降能及减少内存访问,优于现有方法。
Comments To appear in the IEEE Transactions on Circuits and Systems I: Regular Papers (TCAS-I)
通过关联循环记忆扩展大语言模型上下文
机构 * FusionBrain Lab(融合大脑实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Cognitive AI Systems Lab(认知人工智能系统实验室) ; RUDN(俄罗斯人民友谊大学) ; London Institute for Mathematical Sciences(伦敦数学科学研究所) ; MIRAI(未来人工智能研究机构) ; Lomonosov Moscow State University(莫斯科国立罗蒙诺索夫大学) ; Laboratory for Analysis and Controllable Text Generation Technologies RAS(俄罗斯科学院分析与可控文本生成技术实验室) ; School of Natural Sciences, Institute for Advanced Study, Princeton(普林斯顿高等研究院自然科学学院) ; Department of Brain Sciences, Weizmann Institute of Science(魏茨曼科学研究所脑科学系)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究如何通过关联循环记忆扩展大语言模型上下文长度。提出ARMT方法,构建特定数据集,给出综合训练方法。实验表明该方法能让模型处理超长输入,更好泛化,且降低计算量。
从权重到特征:SAE引导的激活正则化用于大语言模型持续学习
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 针对大语言模型持续学习中的灾难性遗忘问题,提出利用预训练稀疏自编码器(SAE)在激活空间进行正则化,通过特征掩码平衡稳定性和可塑性,无需旧任务数据,内存效率高,在TRACE和MedCL基准上超越EWC等方法。
Comments 21 pages, 4 figures, 6 tables
SMSR:针对持久化LLM代理系统中运行时内存投毒的认证防御
机构 * Independent Researcher(独立研究者)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出SMSR防御框架,通过写入时HMAC签名和查询时随机化内存消融与基于判决的多数投票,首次为多会话内存投毒攻击提供认证鲁棒性保证。
并行因果关联域:用于长上下文语言建模的门控稀疏记忆
机构 * Independent Researcher(独立研究员)
专题命中 长上下文与记忆 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 提出并行因果关联域(PCAF),通过哈希桶存储局部记录、检索候选集形成稀疏缓存,并与参数化语言模型门控混合,实现稀疏长上下文访问,避免固定状态瓶颈。
Comments 17 pages, 5 figures, and 6 tables. Experiments on WikiText-103, PG-19, and WikiText-2 using TPU v4-32 and NVIDIA RTX 3060 hardware. Code: https://github.com/ahmed123hds/PCAF
MeMo:迈向具有联想记忆机制的语言模型
机构 * Human-centric ART, University of Rome Tor Vergata(人文导向的ART,罗马大学Tor Vergata) ; University of Edinburgh(爱丁堡大学) ; Almawave S.p.A.(Almawave公司)
专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 提出MeMo架构,通过分层联想记忆直接记忆文本,实现透明化和模型编辑,实验证明单层和多层配置的记忆能力。
Journal ref Proceedings of Association for Computational Linguistics (Findings), 2025
用语言模型模拟人类记忆
机构 * NYU(纽约大学) ; UMass Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 长上下文与记忆 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过心理学经典记忆实验对比语言模型与人类记忆,发现未经调优的模型记忆优于人类,但通过提示策略和压缩器可使模型遗忘方式更接近人类,从而在下游教育任务中成为更有效的用户模拟器。
APEX:自主策略探索用于自演化大语言模型代理
机构 * National University of Singapore(新加坡国立大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出APEX,一种用于自演化大语言模型代理的自主策略探索方法,通过构建和维护显式的策略空间来解决探索崩溃问题,并在多个基准测试中表现出色。
面向大语言模型的信息检索:一种去噪优先的视角
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种以去噪为核心的信息检索方法,强调在信息检索全流程中,最大化可利用证据密度和可验证性是关键瓶颈,通过四个阶段框架和信号-噪声优化技术分类,探讨了信息检索中的挑战和解决方案。
Comments SIGIR 2026
内存增强型大语言模型代理中的状态污染
机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了内存增强型大语言模型代理中由于状态污染导致的安全问题,通过分析内存总结中的毒性内容传播,提出了一种新的衡量指标,并指出在信息压缩前进行净化可以有效减少潜在影响。
信念引擎:多智能体大语言模型协商中的可配置和可检查立场动态
机构 * ETH Zurich(苏黎世联邦理工学院) ; Centre for Democracy Studies Aarau, University of Zurich(苏黎世大学民主研究中心) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Belief Engine,通过可配置的信念更新机制,研究多智能体协商中的立场动态,揭示立场变化背后的证据吸收与锚定因素。
前瞻性引导的记忆检索:语言模型中的记忆检索
机构 * University of Washington(华盛顿大学) ; Microsoft Research(微软研究院)
专题命中 长上下文与记忆 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 前瞻性引导的记忆检索通过模拟未来步骤来增强长周期检索,提升用户个性化需求的响应质量。
Comments Preprint
PRISM:探究语言模型幻觉中的推理、指令和来源记忆
机构 * HKUST(GZ)(香港科技大学(广州)) ; NYUSH(纽约大学上海分校) ; DUFE(东华大学) ; CUHK(SZ)(香港城市大学(深圳)) ; CUFE(中国金融学院)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 PRISM通过四个维度分析语言模型幻觉,提供细粒度诊断评估,揭示不同模型在指令遵循、记忆检索和逻辑推理上的权衡。
Comments Accepted by ACL main conference 2026
回望以推导前行:用于长上下文LLM代理的可回溯记忆
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; DP Technology(DP科技) ; Meituan(美团)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 ReMemR1通过整合记忆检索机制和多级奖励设计,提升长上下文问答任务的推理能力与效率。
当分治策略在长上下文LLM中何时有效?一种噪声分解框架
机构 * University of Chicago(芝加哥大学) ; Together AI ; Duke University(杜克大学) ; Google DeepMind(谷歌DeepMind) ; Stanford University(斯坦福大学)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种噪声分解框架,分析了长上下文LLM中分治策略的有效条件,揭示了任务噪声、模型噪声和聚合噪声的区分,并通过实验验证了多代理分块策略在处理长上下文任务中的有效性。
Comments ICLR 2026
BudgetMem: 为语言模型中的低成本长上下文处理学习选择性记忆策略
机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 BudgetMem通过学习选择性记忆策略,在语言模型中实现低成本长上下文处理,相比基线RAG节省72.4%内存且F1分数仅下降1.0%。
Comments 11 pages, 3 figures, 5 tables. Evaluated on 700 QA pairs across multiple document lengths
分层自适应淘汰用于多模态语言模型的KV缓存管理
机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)
专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出HAE框架,通过双注意力修剪和动态解码淘汰策略优化多模态语言模型的KV缓存管理,减少内存使用并提升推理效率。
Comments 10 oages, 3 figures