arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4797 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4797 篇

2605.01229 2026-05-05 cs.LG cs.CL 62%

Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation

大规模多语言神经机器翻译中的注意力 sinks:发现、分析与缓解

Hillary Mutisya, John Mugane

机构 * Harvard University(哈佛大学)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 研究发现神经机器翻译中跨注意力模式存在注意力 sinks,非内容token占据大部分注意力质量,影响相似性评估,提出内容过滤方法以恢复语言信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07791 2026-04-21 cs.AI cs.LG 62%

SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents

SEARL:自进化智能体中策略与工具图记忆的联合优化

Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 SEARL通过构建结构化经验记忆实现策略与工具图记忆的联合优化,提升智能体在知识推理和数学任务中的实用性和效率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04008 2026-04-21 cs.LG cs.AI 62%

RACE Attention: A Strictly Linear-Time Attention Layer for Training on Outrageously Large Contexts

RACE 注意力:一种严格线性时间的注意力层,用于在极端长上下文中训练

Sahil Joshi, Agniva Chowdhury, Amar Kanakamedala, Ekam Singh, Evan Tu, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 RACE 注意力通过替代指数核为锐化角相似性,并利用高斯随机投影和软局部敏感哈希,实现线性时间复杂度的注意力层,适用于超长上下文训练,同时减少时间和内存消耗。

Comments Accepted at ICLR 2026. 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15356 2026-04-20 cs.LG cs.AI cs.IT cs.NE math.IT 62%

Sequential KV Cache Compression via Probabilistic Language Tries: Beyond the Per-Vector Shannon Limit

基于概率语言tries的序列KV缓存压缩:超越每向量香农极限

Gregory Magarshak

机构 * faculty.ienyc.edu(伊恩耶克大学教员)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出序列KV压缩方法,通过概率前缀去重和预测delta编码,实现超越每向量香农极限的压缩,理论压缩比达914000倍。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-04-14 cs.CL cs.AI 62%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08256 2026-04-13 cs.CL cs.AI 62%

HyperMem: Hypergraph Memory for Long-Term Conversations

HyperMem:用于长期对话的超图记忆

Juwei Yue, Chuanrui Hu, Jiawei Sheng, Zuyi Zhou, Wenyuan Zhang, Tingwen Liu, Li Guo, Yafeng Deng

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) EverMind AI

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 HyperMem通过超图结构建模高阶关联,提升长期对话中的记忆检索效率与准确性,实验表明其在LoCoMo基准上达到92.73%的LLM-as-a-judge准确率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07809 2026-04-10 cs.LG cs.AI 62%

PolicyLong: Towards On-Policy Context Extension

PolicyLong:迈向基于策略的上下文扩展

Junlong Jia, Ziyang Chen, Xing Wu, Chaochen Gao, TingHao Yu, Feng Zhang, Songlin Hu

机构 * Hunyuan Team, Tencent(腾讯混元团队) Chinese Academy of Sciences(中国科学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 PolicyLong通过动态在线策略方法解决LLM上下文扩展中的数据稀缺问题,通过迭代重新执行数据筛选,确保训练分布与模型能力同步,提升长上下文性能。

Comments Work in progress. Correspondence to ucaswu@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06845 2026-04-09 cs.CL cs.AI 62%

HingeMem: Boundary Guided Long-Term Memory with Query Adaptive Retrieval for Scalable Dialogues

HingeMem: 基于边界的长期记忆与查询自适应检索用于可扩展对话

Yijie Zhong, Yunfan Gao, Haofen Wang

机构 * College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 HingeMem通过边界引导的长期记忆和查询自适应检索,提升对话系统在多轮交互中的记忆效率与适应性,实验表明在不同规模的LLM上实现20%的性能提升并降低计算成本。

Comments Accepted by TheWebConf 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06070 2026-04-08 cs.CL cs.LG 62%

Short Data, Long Context: Distilling Positional Knowledge in Transformers

短数据,长上下文:在Transformer中蒸馏位置知识

Patrick Huber, Ernie Chang, Chinnadhurai Sankar, Rylan Conway, Igor Fedorov, Md Rifat Arefin, Adithya Sagar

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过基于logit的知识蒸馏,在不使用长上下文预训练的情况下,实现了长上下文检索能力的转移,揭示了位置信息在模型中的传播机制及参数更新模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-04-06 cs.CL cs.AI cs.IR 62%

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00556 2026-04-02 cs.LG cs.AI cs.ET q-fin.CP q-fin.RM 62%

HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation

HabitatAgent:一种端到端的多智能体系统用于住房咨询

Hongyang Yang, Yanxin Zhang, Yang She, Yue Xiao, Hao Wu, Yiyang Zhang, Jiapeng Hou, Rongshan Zhang

机构 * Fangdongdong(方东东) Tsinghua University(清华大学) Columbia University(哥伦比亚大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HabitatAgent,一种基于LLM的多智能体系统,通过四个专业角色提供可审计且可靠的住房咨询流程,实现高准确率的住房选择支持。

Comments Accepted at the DMO-FinTech Workshop (PAKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30033 2026-04-01 cs.LG cs.AI 62%

Tucker Attention: A generalization of approximate attention mechanisms

Tucker Attention: 多头自注意机制近似机制的推广

Timon Klein, Jonas Kusch, Sebastian Sager, Stefan Schnake, Steffen Schotthöfer

机构 * Otto von Guericke University Magdeburg(奥托·冯·格里克大学马格德堡) Max Planck Institute for Dynamics of Complex Technical Systems(马克斯·普朗克复杂技术系统动力学研究所) Norwegian University of Life Sciences(挪威生命科学大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tucker Attention,通过改进自注意层的权重对象和分解策略,实现更高效的参数方案,相比GQA和MLA在参数量上更优,并兼容Flash Attention和RoPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04427 2026-03-31 cs.LG cs.AI 62%

Thin Keys, Full Values: Reducing KV Cache via Low-Dimensional Attention Selection

细键,全值:通过低维注意力选择减少KV缓存

Hengshuai Yao, Xing Chen, Ahmed Murtadha, Guan Wang

机构 * Sapient Intelligence Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过低维注意力选择减少KV缓存,展示选择仅需O(logN)维度即可区分N个相关token类别,相比传统Transformer注意力节省参数和训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16950 2026-03-26 cs.LG cs.AI cs.IT math.IT 62%

Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning

瓶颈化Transformer:用于通用推理的周期性KV缓存整合

Adnan Oomerjee, Zafeirios Fountas, Haitham Bou-Ammar, Jun Wang

机构 * University College London(伦敦大学学院) Huawei Noah’s Ark(华为诺亚方舟)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出瓶颈化Transformer,通过周期性非因果的KV重写提升推理能力,基于信息瓶颈理论分析其有效性,并在数学推理任务中验证性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09604 2026-03-26 cs.LG cs.AI cs.CR 62%

Mitigating Many-Shot Jailbreaking

缓解多示例劫持

Christopher M. Ackerman, Nina Panickssery

专题命中 长上下文与记忆 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过微调和输入净化缓解多示例劫持攻击的有效性,发现组合方法显著降低攻击效果,同时保持模型在正常上下文学习中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23840 2026-03-26 cs.AI cs.CL 62%

VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents

VehicleMemBench:多用户长期记忆的可执行基准

Yuhao Chen, Yi Xu, Xinyun Ding, Xiang Fang, Shuochen Liu, Luxi Lin, Qingyu Zhang, Ya Li, Quan Liu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院) Xiamen University(厦门大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VehicleMemBench,用于评估车载代理的多用户长期记忆能力,通过可执行仿真环境比较行动后环境状态与目标状态,揭示强大模型在动态偏好变化场景中的不足,强调需更 robust 的记忆管理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20586 2026-03-25 cs.LG cs.AI 62%

MKA: Memory-Keyed Attention for Efficient Long-Context Reasoning

MKA:用于高效长上下文推理的内存键注意

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MKA机制,通过多级KV缓存和动态路由提升长上下文推理效率,FastMKA在保持准确率的同时显著提升训练速度和评估效率。

Comments Accepted to the ACM Computing Frontiers 2026 Conference (Oral Presentation) and the ICML 2025 Long Context Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05919 2026-03-25 cs.CR cs.AI cs.CL 62%

Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs

注入虚假信息:对抗性中间人攻击削弱大语言模型的事实回忆

Alina Fastowski, Bardh Prenkaj, Yuxiao Li, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个基于提示注入的LLM事实记忆攻击评估框架Xmera,通过扰动输入在封闭书本和事实基础QA场景中降低响应正确性并评估生成过程的不确定性,提出基于响应不确定性的随机森林分类器作为防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22333 2026-03-25 cs.LG cs.AI 62%

Graph Signal Processing Meets Mamba2: Adaptive Filter Bank via Delta Modulation

图信号处理与Mamba2交汇:通过Delta调制实现自适应滤波器组

Yehjin Shin, Seojin Kim, Noseong Park

机构 * KAIST(韩国科学技术院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HADES框架,将Mamba2重新解释为线图上的自适应滤波器组,通过结构化偏置实现全局低通和局部高通滤波,提升效率和可解释性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22329 2026-03-25 cs.LG cs.AI 62%

Trained Persistent Memory for Frozen Decoder-Only LLMs

训练的持久内存用于冻结的解码器-only LLMs

Hong Jeong

机构 * Inha University in Tashkent, Uzbekistan(乌兹别克斯坦塔什克恩的因哈大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究解码器-only LLMs中持久内存的实现,通过六种方法在冻结的GPT-2上训练小型适配器,发现架构先验对保留内存性能有显著影响,且在10倍容量下所有方法均收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08435 2026-03-19 cs.LG cs.AI q-bio.NC 62%

Fast weight programming and linear transformers: from machine learning to neurobiology

快速权重编程与线性变换器:从机器学习到神经生物学

Kazuki Irie, Samuel J. Gershman

机构 * Harvard University(哈佛大学) Center for Brain Science(脑科学中心) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了快速权重编程器(FWPs)的理论基础、计算特性及其与变换器和状态空间模型的联系,并讨论了FWPs与大脑突触可塑性模型的关联,揭示了自然与人工智能的交汇。

Comments Accepted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13258 2026-03-17 cs.LG cs.AI cs.SE 62%

Your Code Agent Can Grow Alongside You with Structured Memory

你的代码代理可以与你一同成长,借助结构化记忆

Yi-Xuan Deng, Xiaoqin Liu, Yi Zhang, Guo-Wei Yang, Shuojin Yang

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。

Comments Code Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09982 2026-03-13 cs.CL cs.AI 62%

AraModernBERT: Transtokenized Initialization and Long-Context Encoder Modeling for Arabic

AraModernBERT:阿拉伯语的转令牌初始化和长上下文编码器建模

Omar Elshehy, Omer Nacar, Abdelbasset Djamai, Muhammed Ragab, Khloud Al Jallad, Mona Abdelazim

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 AraModernBERT通过转令牌初始化和长上下文建模提升了阿拉伯语的编码器性能,验证了其在多种自然语言理解任务中的有效性。

Comments 9 pages, 1 figure. Accepted at AbjadNLP Workshop, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10291 2026-03-12 cs.AI cs.LG 62%

Hybrid Self-evolving Structured Memory for GUI Agents

混合自进化结构记忆用于GUI代理

Sibo Zhu, Wenyi Wu, Kun Zhou, Stephen Wang, Biwei Huang

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 HyMEM通过结合离散符号节点与连续轨迹嵌入,提升GUI代理的结构化记忆与自进化能力,使开源模型性能超越闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01313 2026-03-12 cs.CL cs.AI 62%

Evaluating Long-Horizon Memory for Multi-Party Collaborative Dialogues

评估多方协作对话的长周期记忆

Chuanrui Hu, Tong Li, Xingze Gao, Hongda Chen, Yi Bai, Dannong Xu, Tianwei Lin, Xiaohong Li, Yunyun Han, Jian Pei, Yafeng Deng

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EverMemBench,首个评估多方协作对话长周期记忆的基准,揭示当前系统在多跳推理、时间推理和记忆意识方面的局限性。

Comments 25 pages, 21 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05498 2026-03-06 cs.AI cs.CL 62%

The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks

尖峰、稀疏与汇点:大规模激活与注意力汇点的解剖

Shangwen Sun, Alfredo Canziani, Yann LeCun, Jiachen Zhu

机构 * New York University(纽约大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了Transformer中大规模激活与注意力汇点的关联性及作用机制,指出预归一化配置是二者共存的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04688 2026-03-06 q-bio.NC cs.AI cs.LG stat.ML 62%

Why the Brain Consolidates: Predictive Forgetting for Optimal Generalisation

为何大脑进行巩固:为最优泛化而预测遗忘

Zafeirios Fountas, Adnan Oomerjee, Haitham Bou-Ammar, Jun Wang, Neil Burgess

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(大学计算机科学系人工智能中心) UCL Institute of Cognitive Neuroscience, University College London(大学认知神经科学研究所) UCL Queen Square Institute of Neurology, University College London(大学Queen Square神经学研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出高容量神经网络通过预测遗忘优化存储表征的泛化能力,揭示了离线巩固在优化保留与泛化权衡中的计算作用。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01966 2026-03-03 cs.CL cs.AI 62%

AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

AMemGym:用于长时对话中助手的交互式记忆基准测试

Cheng Jiayang, Dongyu Ru, Lin Qiu, Yiyang Li, Xuezhi Cao, Yangqiu Song, Xunliang Cai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 AMemGym通过交互式环境实现长时对话中助手的内存管理优化,揭示现有内存系统性能差距并推动策略自我进化。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16640 2026-03-03 cs.CL cs.AI 62%

Long-Context Generalization with Sparse Attention

长上下文泛化与稀疏注意力

Pavlo Vasylenko, Hugo Pitorro, André F. T. Martins, Marcos Treviso

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司) ELLIS Unit Lisbon(里斯本ELLIS单位)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ASEntmax,通过动态稀疏注意力机制提升长上下文泛化能力,在合成任务和语言建模中表现优于传统softmax和α-entmax方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01481 2026-03-03 cs.LG cs.CL 62%

Intrinsic Entropy of Context Length Scaling in LLMs

大语言模型中上下文长度扩展的内在熵

Jingzhe Shi, Qinwei Ma, Hongyi Liu, Hang Zhao, Jeng-Neng Hwang, Lei Li

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Carnegie Mellon University(卡内基梅隆大学) CPHOS University of Washington(华盛顿大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出'内在熵'理论,通过实验验证长上下文对语言模型的影响,揭示训练数据集大小与最佳上下文长度的关系。

Comments 36 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏