arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2409.10482 2024-09-30 cs.CL 89%

Schrodinger's Memory: Large Language Models

Wei Wang, Qing Li

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17052 2024-09-04 cs.CL 89%

SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself

Jun Gao, Ziqiang Cao, Wenjie Li

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03841 2024-08-08 cs.SE cs.AI 89%

MaxMind: A Memory Loop Network to Enhance Software Productivity based on Large Language Models

Yuchen Dong, XiaoXiang Fang, Yuchen Hu, Renshuang Jiang, Zhe Jiang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14838 2024-07-23 cs.CR cs.AI 89%

Retrieval Augmented Generation Integrated Large Language Models in Smart Contract Vulnerability Detection

Jeffy Yu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 17 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14239 2024-07-22 cs.AI 89%

KoMA: Knowledge-driven Multi-agent Framework for Autonomous Driving with Large Language Models

Kemou Jiang, Xuan Cai, Zhiyong Cui, Aoyong Li, Yilong Ren, Haiyang Yu, Hao Yang, Daocheng Fu, Licheng Wen, Pinlong Cai

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 13 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01809 2024-07-16 cs.CL 89%

Are Emergent Abilities in Large Language Models just In-Context Learning?

Sheng Lu, Irina Bigoulaeva, Rachneet Sachdeva, Harish Tayyar Madabushi, Iryna Gurevych

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00065 2024-07-02 physics.ed-ph cs.AI 89%

A Personalised Learning Tool for Physics Undergraduate Students Built On a Large Language Model for Symbolic Regression

Yufan Zhu, Zi-Yu Khoo, Jonathan Sze Choong Low, Stephane Bressan

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18193 2024-06-27 cs.CV cs.AI 89%

MammothModa: Multi-Modal Large Language Model

Qi She, Junwen Pan, Xin Wan, Rui Zhang, Dawei Lu, Kai Huang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03092 2024-06-06 cs.CL 89%

FragRel: Exploiting Fragment-level Relations in the External Memory of Large Language Models

Xihang Yue, Linchao Zhu, Yi Yang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17463 2024-05-30 cs.CL 89%

Training-Free Long-Context Scaling of Large Language Models

Chenxin An, Fei Huang, Jun Zhang, Shansan Gong, Xipeng Qiu, Chang Zhou, Lingpeng Kong

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18093 2024-05-29 cs.DC cs.LG 89%

Pipette: Automatic Fine-grained Large Language Model Training Configurator for Real-World Clusters

Jinkyu Yim, Jaeyong Song, Yerim Choi, Jaebeen Lee, Jaewon Jung, Hongsun Jang, Jinho Lee

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments published at DATE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17915 2024-05-29 cs.CL 89%

Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language Models

Longze Chen, Ziqiang Liu, Wanwei He, Yunshui Li, Run Luo, Min Yang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 13 pages, 5 figures, ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09397 2024-05-09 cs.AI 89%

Personalized Autonomous Driving with Large Language Models: Field Experiments

Can Cui, Zichong Yang, Yupeng Zhou, Yunsheng Ma, Juanwu Lu, Lingxi Li, Yaobin Chen, Jitesh Panchal, Ziran Wang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13501 2024-04-23 cs.AI 89%

A Survey on the Memory Mechanism of Large Language Model based Agents

Zeyu Zhang, Xiaohe Bo, Chen Ma, Rui Li, Xu Chen, Quanyu Dai, Jieming Zhu, Zhenhua Dong, Ji-Rong Wen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 39 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01411 2024-03-05 cs.CL 89%

OVEL: Large Language Model as Memory Manager for Online Video Entity Linking

Haiquan Zhao, Xuwu Wang, Shisong Chen, Zhixu Li, Xin Zheng, Yanghua Xiao

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16292 2024-02-23 cs.RO cs.CL 89%

DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models

Licheng Wen, Daocheng Fu, Xin Li, Xinyu Cai, Tao Ma, Pinlong Cai, Min Dou, Botian Shi, Liang He, Yu Qiao

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Published as a conference paper at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13449 2024-02-22 cs.CL 89%

CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory

Zexue He, Leonid Karlinsky, Donghyun Kim, Julian McAuley, Dmitry Krotov, Rogerio Feris

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11573 2024-02-20 cs.CL 89%

BGE Landmark Embedding: A Chunking-Free Embedding Method For Retrieval Augmented Long-Context Large Language Models

Kun Luo, Zheng Liu, Shitao Xiao, Kang Liu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07793 2024-01-17 cs.CL 89%

Flexibly Scaling Large Language Models Contexts Through Extensible Tokenization

Ninglu Shao, Shitao Xiao, Zheng Liu, Peitian Zhang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01954 2023-12-05 cs.CL 89%

Zero- and Few-Shots Knowledge Graph Triplet Extraction with Large Language Models

Andrea Papaluca, Daniel Krefl, Sergio Mendez Rodriguez, Artem Lensky, Hanna Suominen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13829 2023-10-25 cs.CL 89%

Learning from Mistakes via Cooperative Study Assistant for Large Language Models

Danqing Wang, Lei Li

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by EMNLP 2023 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03473 2023-10-06 cs.CL 89%

Controllable Multi-document Summarization: Coverage & Coherence Intuitive Policy with Large Language Model Based Rewards

Litton J Kurisinkel, Nancy F chen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10947 2023-08-02 cs.CL 89%

Parallel Context Windows for Large Language Models

Nir Ratner, Yoav Levine, Yonatan Belinkov, Ori Ram, Inbal Magar, Omri Abend, Ehud Karpas, Amnon Shashua, Kevin Leyton-Brown, Yoav Shoham

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments The 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15156 2026-05-21 cs.CL cs.AI cs.LG 89%

MeMo: Memory as a Model

MeMo:记忆作为模型

Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bryan Kian Hsiang Low, Daniela Rus, Armando Solar-Lezama

机构 * Institute of Data Science, National University of Singapore(数据科学研究院,新加坡国立大学) Integrative Sciences and Engineering Programme, NUSGS(整合科学与工程计划,NUSGS) Agency for Science, Technology, Research (A*STAR)(科技研究局(A*STAR)) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) University of Tokyo(东京大学) Liquid AI CSAIL, Massachusetts Institute of Technology(CSAIL,麻省理工学院) AI Singapore Singapore-MIT Alliance for Research and Technology Centre, Singapore(新加坡-麻省理工学院研究与技术中心,新加坡)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出MeMo框架,通过在不改变LLM参数的情况下将新知识编码到专用记忆模型中,解决了大型语言模型在需要及时领域特定信息的应用中的问题,同时具备处理复杂跨文档关系、抗检索噪声、避免灾难性遗忘、无需访问LLM权重或输出logits以及检索成本与语料库大小无关等优势。

Comments MeMo augments any LLM with up-to-date or domain-specific knowledge via a trained memory model, avoiding costly retraining, mitigating catastrophic forgetting, and remaining robust to retrieval noise

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02560 2026-08-04 cs.LG cs.AI cs.IR 新提交 89%

Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection

边缘语言模型的结构化记忆:通过O(1) SSM状态注入实现持久上下文与语料库检索

Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson

机构 * BrainChip Inc.(BrainChip公司)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对边缘语言模型提出PRECOG与SMC机制,将SSM预填充成本压缩至O(1),在1.2B参数的TENNs-LLM上实现约4500倍预填充加速,达到与RAG相当的答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25475 2026-07-07 cs.CL cs.AI 版本更新 89%

IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

IndexMem: 基于潜在记忆的学习型KV缓存驱逐策略用于长上下文LLM推理

Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Yike Guo, Sirui Han

机构 * The Hong Kong University of Science(香港科学与技术大学) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种可学习的索引器预测KV重要性,并结合轻量级潜在记忆模块压缩被驱逐的令牌,以在有限KV预算下实现准确的长上下文推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29824 2026-06-30 cs.CL cs.AI 89%

Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering

神经程序记忆:通过隐式激活引导赋予LLM智能体能力

Chengfeng Zhao, Yuqiao Tan, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出神经程序记忆(NPM),一种无训练框架,通过隐式激活引导而非显式指令表示智能体记忆,从历史对比经验中提取程序技能为激活空间中的引导向量,直接激活任务相关神经机制以指导执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08340 2026-06-09 cs.AI cs.LG cs.MA 新提交 89%

Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

开放式多智能体协作在语言智能体中的基准测试

Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Gouk, Elliot J. Crowley, Tim Rocktäschel, Amos Storkey

机构 * University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language agent(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于JAX的开放式多智能体协作基准Alem,评估13种现代LLM在长时生存世界中的零样本协作能力,发现协调能力是前沿LLM智能体的独立瓶颈。

Comments 42 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14209 2026-06-08 cs.LG cs.CL 版本更新 89%

MAGE: All-[MASK] Block Already Knows Where to Look in Block Diffusion LLM

MAGE:在块扩散LLM中,全[MASK]块已经知道在哪里看

Omin Kwon, Yeonjae Kim, Doyeon Kim, Minseo Kim, Yeonhong Park, Jae W. Lee

机构 * Seoul National University(首尔国立大学) Meta

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 针对块扩散LLM长上下文推理中KV缓存导致的内存瓶颈,提出无训练方法MAGE,利用块扩散训练目标的对齐特性,在第一步确定整个轨迹的KV子集,实现近无损精度和显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17535 2026-04-21 cs.CL cs.AI 89%

OPSDL: On-Policy Self-Distillation for Long-Context Language Models

OPSDL:针对长上下文语言模型的在线自蒸馏

Xinsen Zhang, Zhenkai Ding, Tianjun Pan, Run Yang, Chun Kang, Xue Xiong, Jingnan Gu

机构 * Baidu Inc(百度公司)

专题命中 长上下文与记忆 :language model(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);post-training(abstract)

AI总结 OPSDL通过在线自蒸馏方法提升长上下文能力,利用模型自身短上下文能力作为自教师,通过点-wise KL散度提供每token监督信号,有效减少幻觉并提升样本效率,优于传统后训练方法。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏