Schrodinger's Memory: Large Language Models
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments 17 pages, 3 figures, 4 tables
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments 13 pages, 18 figures
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
Comments Accepted to ACL 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments Technical report
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
Comments published at DATE 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments 13 pages, 5 figures, ACL 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments 39 pages, 5 figures, 4 tables
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments 13 pages, 6 figures
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Published as a conference paper at ICLR 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted by EMNLP 2023 main conference
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments The 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023)
MeMo:记忆作为模型
机构 * Institute of Data Science, National University of Singapore(数据科学研究院,新加坡国立大学) ; Integrative Sciences and Engineering Programme, NUSGS(整合科学与工程计划,NUSGS) ; Agency for Science, Technology, Research (A*STAR)(科技研究局(A*STAR)) ; Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) ; University of Tokyo(东京大学) ; Liquid AI ; CSAIL, Massachusetts Institute of Technology(CSAIL,麻省理工学院) ; AI Singapore ; Singapore-MIT Alliance for Research and Technology Centre, Singapore(新加坡-麻省理工学院研究与技术中心,新加坡)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出MeMo框架,通过在不改变LLM参数的情况下将新知识编码到专用记忆模型中,解决了大型语言模型在需要及时领域特定信息的应用中的问题,同时具备处理复杂跨文档关系、抗检索噪声、避免灾难性遗忘、无需访问LLM权重或输出logits以及检索成本与语料库大小无关等优势。
Comments MeMo augments any LLM with up-to-date or domain-specific knowledge via a trained memory model, avoiding costly retraining, mitigating catastrophic forgetting, and remaining robust to retrieval noise
边缘语言模型的结构化记忆:通过O(1) SSM状态注入实现持久上下文与语料库检索
机构 * BrainChip Inc.(BrainChip公司)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对边缘语言模型提出PRECOG与SMC机制,将SSM预填充成本压缩至O(1),在1.2B参数的TENNs-LLM上实现约4500倍预填充加速,达到与RAG相当的答案质量。
IndexMem: 基于潜在记忆的学习型KV缓存驱逐策略用于长上下文LLM推理
机构 * The Hong Kong University of Science(香港科学与技术大学) ; Zhejiang University(浙江大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出一种可学习的索引器预测KV重要性,并结合轻量级潜在记忆模块压缩被驱逐的令牌,以在有限KV预算下实现准确的长上下文推理。
神经程序记忆:通过隐式激活引导赋予LLM智能体能力
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出神经程序记忆(NPM),一种无训练框架,通过隐式激活引导而非显式指令表示智能体记忆,从历史对比经验中提取程序技能为激活空间中的引导向量,直接激活任务相关神经机制以指导执行。
开放式多智能体协作在语言智能体中的基准测试
机构 * University of Edinburgh(爱丁堡大学) ; University of Oxford(牛津大学) ; University College London(伦敦大学学院)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language agent(title);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出基于JAX的开放式多智能体协作基准Alem,评估13种现代LLM在长时生存世界中的零样本协作能力,发现协调能力是前沿LLM智能体的独立瓶颈。
Comments 42 pages, preprint
MAGE:在块扩散LLM中,全[MASK]块已经知道在哪里看
机构 * Seoul National University(首尔国立大学) ; Meta
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 针对块扩散LLM长上下文推理中KV缓存导致的内存瓶颈,提出无训练方法MAGE,利用块扩散训练目标的对齐特性,在第一步确定整个轨迹的KV子集,实现近无损精度和显著加速。
OPSDL:针对长上下文语言模型的在线自蒸馏
机构 * Baidu Inc(百度公司)
专题命中 长上下文与记忆 :language model(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);post-training(abstract)
AI总结 OPSDL通过在线自蒸馏方法提升长上下文能力,利用模型自身短上下文能力作为自教师,通过点-wise KL散度提供每token监督信号,有效减少幻觉并提升样本效率,优于传统后训练方法。
Comments 9 pages, 1 figure