arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2606.09937 2026-06-10 cs.LG cs.AI cs.CL 新提交 90%

RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference

RKSC:面向多步LLM推理的感知推理的KV缓存共享与自信提前退出

Anirudh Sekar

机构 * Anirudh Sekar(安尼鲁德·塞卡)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RKSC框架,通过注意力相似性KV共享、置信门控提前退出和推理选择性块缓存管理,消除多分支LLM推理中的结构冗余,实现平均3.008倍加速,错误率仅0.37%。

Comments Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09863 2026-05-12 cs.CR cs.AI cs.CL cs.IR cs.LG 90%

Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents

Nautilus Compass:生产LLM代理的黑盒人格漂移检测

Chunxiao Wang

机构 * Yiluo Technology Co., Ltd.(亿洛科技有限公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 Nautilus Compass通过提示文本层的余弦相似度检测生产编码代理的人格漂移,无需调用LLM提取事实,实现高效且低成本的代理记忆层。

Comments 19 pages, 6 figures. MIT-licensed code + reproduction scripts at github.com/chunxiaoxx/nautilus-compass

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08468 2026-05-12 cs.CL cs.AI cs.LG 90%

PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents

PYTHALAB-MERA:基于验证的内存、检索与接受控制用于冻结LLM编码代理

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University(PythaLab,伊兹密尔技术大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PYTHALAB-MERA通过轻量级外部控制器实现验证基础的内存管理、适应性检索与延迟信用分配,提升冻结本地模型在编码任务中的验证成功率。

Comments 28 pages, 4 figures, 7 tables; local CLI artifact evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27283 2026-05-01 cs.CL cs.AI cs.LG 90%

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理

Mehmet Iscan

机构 * PythaLab Yildiz Technical University(Yildiz技术大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。

Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27773 2026-08-06 cs.CL 版本更新 90%

ChronoMem: Version Control and Semantic Rollback for Large Language Model Agent Memory

ChronoMem:大语言模型智能体记忆的版本控制与语义回滚

Yongye Su, Wujiang Xu, Chaoji Zuo, Elisa Bertino

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 ChronoMem是集成于Google开源智能体开发套件的语义版本控制层,首次实现LLM智能体记忆的语义全局回滚,在长周期对话基准中显著提升回滚一致的问答与历史总结性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03137 2026-08-05 cs.AI 新提交 90%

Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

可验证记忆:为大语言模型智能体学习结合局部与全局验证器的统一记忆管理

Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出VerMem框架,用含七个原子操作的统一策略管理LTM等状态,结合局部与全局验证器训练,在多基准测试中性能与效率均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01885 2026-07-24 cs.CL 版本更新 90%

Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents

代理记忆:为大语言模型代理学习统一的长期和短期记忆管理

Yi Yu, Liuyi Yao, Yuexiang Xie, Qingquan Tan, Jiaqi Feng, Yaliang Li, Libing Wu

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) Alibaba Group(阿里巴巴集团)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Agentic Memory框架,统一管理大语言模型的长期和短期记忆,通过分步GRPO和三阶段强化学习提升记忆效率与任务表现。

Comments ACL'26 SAC Highlight. The code is available at https://github.com/y1y5/AgeMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17182 2026-06-17 cs.LG cs.DC cs.LO cs.MA cs.PL 新提交 90%

Verified Detection and Prevention of Concurrency Anomalies in Multi-Agent Large Language Model Systems

多智能体大语言模型系统中并发异常的可验证检测与预防

Sajjad Khan

机构 * independent researcher(独立研究员)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG

AI总结 针对多智能体LLM系统,形式化四种并发异常并建立一致性层级,通过Verus验证检测器正确性,并在Rust运行时中实现预防。

Comments 32 pages, 2 figures, 6 tables. Verus/TLA+ verification artifact, reference Rust runtime, and Python harnesses, plus a supplementary appendix (Sections A-F, Tables S1-S6), included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29002 2026-06-02 cs.DC cs.AI 90%

Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference

理解并加速大型语言模型推理的内存处理流水线

Zifan He, Rui Ma, Yizhou Sun, Jason Cong

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过将稀疏注意力、检索增强生成和压缩上下文内存等优化统一为四步内存处理流水线,识别出22%-97%的内存处理开销,并提出使用GPU-FPGA异构系统加速该流水线,实现最高2.2倍加速和4.7倍能效提升。

Comments Accepted by ICML 2026. Code: https://github.com/OswaldHe/HeteroLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24949 2026-05-26 cs.CR cs.AI 90%

APT-Agent: Automated Penetration Testing using Large Language Models

APT-Agent:利用大语言模型的自动化渗透测试

William Guanting Li, Alsharif Abuadbba, Kristen Moore, Dan Dongseong Kim

机构 * University of Queensland(昆士兰大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出APT-Agent框架,通过混合修正模块和命令特定记忆架构解决大语言模型在渗透测试中的幻觉和长期记忆问题,在Metasploitable 2上实现84.29%的端到端利用成功率。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17821 2026-05-19 cs.DC cs.AI 90%

TierCheck: Tiered Checkpointing for Fault Tolerance in Large Language Model Training

TierCheck: 用于大语言模型训练故障容错的分层检查点系统

Shujie Han, Feng Jiang, Patrick P. C. Lee, Xiao Zhang, Zhijie Huang, Nannan Zhao, Xiaonan Zhao, Lichen Pan

机构 * Northwestern Polytechnical University(西北工业大学) The Chinese University of Hong Kong(香港中文大学) National University of Defense Technology(国防科技大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TierCheck,一种基于集群意识的分层检查点系统,通过将存储位置与故障异质性对齐,实现轻量级差异检查点在本地和对等内存中的快速本地恢复,同时异步迁移重型基础检查点到远程持久化存储,从而在低开销持久性和快速恢复之间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11813 2026-05-13 cs.AI 90%

Automated Reformulation of Robust Optimization via Memory-Augmented Large Language Models

通过记忆增强的大语言模型实现鲁棒优化的自动化重述

Jinbiao Chen, Shuang Jin, Guoyun Zhang, Junyu Zhang, Guanyi Wang, Hanzhang Qin

机构 * Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Institute of Operations Research and Analytics, National University of Singapore(新加坡国立大学运筹与分析研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出AutoREM框架,通过记忆增强提升鲁棒优化重述的准确性和效率,无需领域知识或参数更新,适用于不同基础大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20943 2026-04-24 cs.LG 90%

SCM: Sleep-Consolidated Memory with Algorithmic Forgetting for Large Language Models

SCM:基于算法遗忘的睡眠巩固记忆用于大语言模型

Saish Sachin Shinde

机构 * Clyrai IP Studio(Clyrai IP实验室)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 SCM通过引入睡眠巩固机制和算法遗忘,解决大语言模型缺乏持久、结构化和生物合理记忆的问题,实现高效记忆管理和检索。

Comments 5 figures. Submitted April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19237 2026-04-21 cs.AI cs.RO 90%

Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots

多模态大语言模型驱动机器人中的躯体自我识别

Iñaki Dellibarda Varela, Pablo Romero-Sorozabal, Diego Torricelli, Gabriel Delgado-Oleas, Jose Ignacio Serrano, Maria Dolores del Castillo Sobrino, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics(自动化与机器人中心) University of Azuay(阿祖亚大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究多模态大语言模型通过躯体运动经验发展自我识别能力,展示机器人在环境感知、自我识别和预测意识方面的表现,揭示感觉整合对最小自我的影响及记忆协调机制。

Comments 16 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21471 2026-04-21 cs.CL 90%

Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration

通过多智能体协作扩展LLM上下文窗口之外的知识输入

Zijun Liu, Zhennan Wan, Peng Li, Ming Yan, Fei Huang, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出ExtAgents框架,通过多智能体协作提升LLM在不延长上下文窗口的情况下整合外部知识的能力,实验证明其在多跳问答和长文本生成任务中优于现有方法。

Comments Accepted to ACL 2026. 31 pages, 10 figures. Code and data are available at https://github.com/THUNLP-MT/ExtAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06679 2026-04-15 cs.CL 90%

E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and Reasoning

E2LLM:用于长上下文理解与推理的编码器扩展大语言模型

Zihan Liao, Jun Wang, Hang Yu, Lingxiao Wei, Jianguo Li, Jun Wang, Wei Zhang

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出E2LLM,通过分块压缩和适配器对齐,解决长上下文处理中的性能、效率与兼容性难题,在文档摘要和问答任务中优于现有方法。

Comments Accept by EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00444 2026-03-10 cs.CL 90%

TokMem: One-Token Procedural Memory for Large Language Models

TokMem: 一个令牌的程序性记忆用于大型语言模型

Zijun Wu, Yongchang Hao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔机器智能研究所(Amii),阿尔伯塔大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 TokMem通过单个可训练令牌实现程序性记忆,提升大型语言模型在任务回忆和多步函数调用中的性能,同时减少训练参数和上下文开销。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12771 2026-01-26 cs.CL 90%

Who Does This Name Remind You of ? Nationality Prediction via Large Language Model Associative Memory

这个名字让你想起谁?通过大语言模型关联记忆进行国籍预测

Keito Inoshita

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 LAMA通过利用大语言模型的关联记忆能力,有效提升国籍预测任务的准确性,其双代理架构在处理不同知识领域时表现出互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19537 2025-12-23 cs.CL 90%

Event Extraction in Large Language Model

大规模语言模型中的事件提取

Bobo Li, Xudong Han, Jiang Liu, Yuzhe Ding, Liqiang Jing, Zhaoqi Zhang, Jinheng Li, Xinya Du, Fei Li, Meishan Zhang, Min Zhang, Aixin Sun, Philip S. Yu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Sussex(苏塞克斯大学) Wuhan University(武汉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文探讨了大规模语言模型中事件提取的系统组件,提出通过事件方案、结构和存储提升事件处理的可靠性与智能体准备性。

Comments 38 pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01710 2025-12-05 cs.CL cs.IR 90%

MMAG: Mixed Memory-Augmented Generation for Large Language Models Applications

MMAG:混合记忆增强生成用于大型语言模型应用

Stefano Zeppieri

机构 * Department of Computer Science, Sapienza University of Rome(罗马大学计算机科学系)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);language agent(abstract)

AI总结 MMAG通过整合五层记忆机制提升大型语言模型在对话中的连贯性、个性化和持续性,通过Heero代理验证其有效性,并探讨了存储、隐私等实施挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03001 2025-12-03 cs.AI 90%

Invasive Context Engineering to Control Large Language Models

侵入式上下文工程以控制大语言模型

Thomas Rivasseau

机构 * McGill University(麦吉尔大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出侵入式上下文工程方法,通过在LLM上下文中插入控制句子以提升其安全性,避免长上下文场景下的数据短缺问题。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22844 2025-10-28 cs.CL 90%

Leveraging Large Language Models to Identify Conversation Threads in Collaborative Learning

Prerna Ravi, Dong Won Lee, Beatriz Flamia, Jasmine David, Brandon Hanks, Cynthia Breazeal, Emma Anderson, Grace Lin

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT Media Lab(麻省理工学院媒体实验室) Instituto Politécnico de Bragança(布拉甘扎理工大学) MIT STEP(麻省理工学院教育技术计划)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments In Submission: Journal of Educational Data Mining (jEDM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05821 2025-08-29 cs.CL 90%

ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models

Zhihang Yuan, Yuzhang Shang, Yue Song, Dawei Yang, Qiang Wu, Yan Yan, Guangyu Sun

机构 * Illinois Institute of Technology(伊利诺伊理工学院) University of Trento(特伦托大学) Peking University(北京大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16799 2025-07-24 cs.CL 90%

Test-Time-Matching: Decouple Personality, Memory, and Linguistic Style in LLM-based Role-Playing Language Agent

Xiaoyu Zhan, Xinyu Fu, Hao Sun, Yuanqi Li, Jie Guo, Yanwen Guo

专题命中 长上下文与记忆 :LLM(title,abstract);language agent(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11836 2025-06-10 cs.LG 90%

Model Generalization on Text Attribute Graphs: Principles with Large Language Models

Haoyu Wang, Shikun Liu, Rongzhe Wei, Pan Li

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03258 2024-12-17 cs.CL 90%

GraphInsight: Unlocking Insights in Large Language Models for Graph Structure Understanding

Yukun Cao, Shuo Han, Zengyi Gao, Zezhong Ding, Xike Xie, S. Kevin Zhou

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10145 2024-12-05 cs.CL 90%

An Effective Framework to Help Large Language Models Handle Numeric-involved Long-context Tasks

Yijiong Yu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00509 2024-09-05 cs.CL 90%

LongRecipe: Recipe for Efficient Long Context Generalization in Large Language Models

Zhiyuan Hu, Yuliang Liu, Jinman Zhao, Suyuchen Wang, Yan Wang, Wei Shen, Qing Gu, Anh Tuan Luu, See-Kiong Ng, Zhiwei Jiang, Bryan Hooi

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20274 2026-08-21 cs.AI cs.CL 新提交 90%

Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

分解与传递:大语言模型智能体的跨任务技能迁移

Yiyang Feng, Biddut Sarker Bijoy, Niranjan Balasubramanian, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究探究LLM智能体跨任务技能迁移的可靠性,对比任务级与子任务级、文本与代码两种技能格式,提出结合特异性与抽象性的技能效用分数,发现子任务级文本技能迁移效果更优,可用于诊断技能记忆。

Comments 34 pages, 28 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03015 2026-08-05 cs.LG cs.AI eess.SP 新提交 90%

A Graph Signal Processing Perspective on Numerical Sequence Representations in LLM In-Context Learning

大语言模型上下文学习中数值序列表示的图信号处理视角

Jiajun Bao, Zihao Qi, Toni J. B. Liu, Gurbir Arora, Raphaël Sarfati, Nicolas Boullé, Christopher J. Earls

机构 * Cornell University(康奈尔大学) Goodfire AI(古德火人工智能公司) Imperial College London(伦敦帝国学院)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从图信号处理视角研究LLM上下文学习中数值序列的表示,发现数值推理的内部特征随上下文长度和输入动态复杂性变化,且在不同模型家族间一致。

详情

展开后加载摘要…

URL PDF HTML 收藏