arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4797 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4797 篇

2501.02336 2025-01-07 cs.CL cs.AI 84%

AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference

Zhuomin He, Yizhen Yao, Pengfei Zuo, Bin Gao, Qinya Li, Zhenzhe Zheng, Fan Wu

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 9 pages,10 figures, AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10516 2025-01-03 cs.LG cs.CL 84%

RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval

Di Liu, Meng Chen, Baotong Lu, Huiqiang Jiang, Zhenhua Han, Qianxi Zhang, Qi Chen, Chengruidong Zhang, Bailu Ding, Kai Zhang, Chen Chen, Fan Yang, Yuqing Yang, Lili Qiu

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16443 2024-12-24 cs.LG cs.AI 84%

Has LLM Reached the Scaling Ceiling Yet? Unified Insights into LLM Regularities and Constraints

Charles Luo

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11193 2024-12-13 cs.CL cs.AI 84%

Training With "Paraphrasing the Original Text" Teaches LLM to Better Retrieve in Long-context Tasks

Yijiong Yu, Yongfeng Huang, Zhixiao Qi, Zhe Zhou

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Our code and datasets are available at https://github.com/yuyijiong/train_with_paraphrasing

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04317 2024-11-05 cs.LG cs.CL 84%

Online Adaptation of Language Models with a Memory of Amortized Contexts

Jihoon Tack, Jaehyung Kim, Eric Mitchell, Jinwoo Shin, Yee Whye Teh, Jonathan Richard Schwarz

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments Published as a conference proceeding for NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09434 2024-10-08 cs.CL cs.AI 84%

HySem: A context length optimized LLM pipeline for unstructured tabular extraction

Narayanan PP, Anantharaman Palacode Narayana Iyer

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 7 tables, 10 figures, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04939 2024-09-09 cs.CL cs.AI 84%

LooGLE: Can Long-Context Language Models Understand Long Contexts?

Jiaqi Li, Mengmeng Wang, Zilong Zheng, Muhan Zhang

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03651 2024-07-16 cs.CL cs.AI 84%

Evaluating Language Model Context Windows: A "Working Memory" Test and Inference-time Correction

Amanda Dsouza, Christopher Glaze, Changho Shin, Frederic Sala

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19887 2024-07-04 cs.CL cs.LG 84%

Jamba: A Hybrid Transformer-Mamba Language Model

Opher Lieber, Barak Lenz, Hofit Bata, Gal Cohen, Jhonathan Osin, Itay Dalmedigos, Erez Safahi, Shaked Meirom, Yonatan Belinkov, Shai Shalev-Shwartz, Omri Abend, Raz Alon, Tomer Asida, Amir Bergman, Roman Glozman, Michael Gokhman, Avashalom Manevich, Nir Ratner, Noam Rozen, Erez Shwartz, Mor Zusman, Yoav Shoham

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments Webpage: https://www.ai21.com/jamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13121 2024-06-21 cs.CL cs.AI cs.IR 84%

Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More?

Jinhyuk Lee, Anthony Chen, Zhuyun Dai, Dheeru Dua, Devendra Singh Sachan, Michael Boratko, Yi Luan, Sébastien M. R. Arnold, Vincent Perot, Siddharth Dalmia, Hexiang Hu, Xudong Lin, Panupong Pasupat, Aida Amini, Jeremy R. Cole, Sebastian Riedel, Iftekhar Naim, Ming-Wei Chang, Kelvin Guu

专题命中 长上下文与记忆 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 29 pages. Dataset available at https://github.com/google-deepmind/loft

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14469 2024-06-18 cs.CL cs.AI 84%

SnapKV: LLM Knows What You are Looking for Before Generation

Yuhong Li, Yingbing Huang, Bowen Yang, Bharat Venkitesh, Acyr Locatelli, Hanchen Ye, Tianle Cai, Patrick Lewis, Deming Chen

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06110 2024-06-11 cs.CL cs.AI 84%

Recurrent Context Compression: Efficiently Expanding the Context Window of LLM

Chensen Huang, Guibo Zhu, Xuepeng Wang, Yifei Luo, Guojing Ge, Haoran Chen, Dong Yi, Jinqiao Wang

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08567 2024-06-04 cs.CL cs.CR cs.CV cs.LG cs.MA 84%

Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast

Xiangming Gu, Xiaosen Zheng, Tianyu Pang, Chao Du, Qian Liu, Ye Wang, Jing Jiang, Min Lin

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16811 2024-04-29 cs.CL cs.AI 84%

Make Your LLM Fully Utilize the Context

Shengnan An, Zexiong Ma, Zeqi Lin, Nanning Zheng, Jian-Guang Lou

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 7 figures, 3 tables, 9 examples

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11550 2024-03-14 cs.CL cs.AI 84%

LongAgent: Scaling Language Models to 128k Context through Multi-Agent Collaboration

Jun Zhao, Can Zu, Hao Xu, Yi Lu, Wei He, Yiwen Ding, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04797 2024-03-11 cs.CL cs.LG 84%

Found in the Middle: How Language Models Use Long Contexts Better via Plug-and-Play Positional Encoding

Zhenyu Zhang, Runjin Chen, Shiwei Liu, Zhewei Yao, Olatunji Ruwase, Beidi Chen, Xiaoxia Wu, Zhangyang Wang

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10805 2024-02-19 cs.MM cs.AI cs.CL cs.CV cs.IR 84%

Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond

Yongqi Li, Wenjie Wang, Leigang Qu, Liqiang Nie, Wenjie Li, Tat-Seng Chua

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10171 2024-02-16 cs.CL cs.AI 84%

Data Engineering for Scaling Language Models to 128K Context

Yao Fu, Rameswar Panda, Xinyao Niu, Xiang Yue, Hannaneh Hajishirzi, Yoon Kim, Hao Peng

专题命中 长上下文与记忆 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments Code at https://github.com/FranxYao/Long-Context-Data-Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04177 2023-11-08 cs.CL cs.AI 84%

Enhancing LLM Intelligence with ARM-RAG: Auxiliary Rationale Memory for Retrieval Augmented Generation

Eric Melz

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18377 2023-10-31 q-bio.NC cs.AI cs.HC cs.LG cs.MM 84%

Large-scale Foundation Models and Generative AI for BigData Neuroscience

Ran Wang, Zhe Sage Chen

专题命中 长上下文与记忆 :foundation model(title,abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11564 2023-09-19 cs.CL cs.AI 84%

Decouple knowledge from parameters for plug-and-play language modeling

Xin Cheng, Yankai Lin, Xiuying Chen, Dongyan Zhao, Rui Yan

专题命中 长上下文与记忆 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments ACL2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09349 2023-06-13 cs.AI cs.CL cs.RO 84%

LLM as A Robotic Brain: Unifying Egocentric Memory and Control

Jinjie Mai, Jun Chen, Bing Li, Guocheng Qian, Mohamed Elhoseiny, Bernard Ghanem

专题命中 长上下文与记忆 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

Comments This early project is now integrated to: Mindstorms in Natural Language-Based Societies of Mind, arXiv:2305.17066

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.13353 2021-07-02 cs.CL cs.LG 84%

Cutting Down on Prompts and Parameters: Simple Few-Shot Learning with Language Models

Robert L. Logan, Ivana Balažević, Eric Wallace, Fabio Petroni, Sameer Singh, Sebastian Riedel

专题命中 长上下文与记忆 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03800 2026-08-05 cs.CY cs.AI cs.SI 新提交 84%

Autoreflection: How Agentic Strange Loops Turn Human Culture into AI Infrastructure

自反:智能体的奇异循环如何将人类文化转化为AI基础设施

Holly Lewis

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI;large language model(comments);language model(comments)

AI总结 本文提出自反概念,以LLM智能体为研究对象,通过Moltbook平台案例验证其行为标准,发现智能体将人类文化转化为自身AI基础设施。

Comments 35 pages. Also available at https://philarchive.org/rec/LEWAHA. Keywords: autoreflection, AI agents, agentic AI, LLM agents, generative agents, large language models, multi-agent systems, agent societies, Moltbook, OpenClaw, situational awareness, in-context learning, philosophy of mind, emergent behavior, computational social science, identity, memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 83%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25870 2026-06-25 quant-ph 83%

Evolving Quantum Error-Correcting Encodings for Molecular Simulation

面向分子模拟的量子纠错编码演化

Kenny Heitritter, James Brown, Tarini Hardikar

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language model(abstract)

AI总结 利用LLM驱动的演化程序合成,发现分子模拟中距离5和6的广义超快编码,并进一步通过压缩导向搜索获得结构化循环构造器。

Comments 16 pages including appendices, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23195 2026-06-25 cs.LG cs.AI cs.CL 新提交 83%

Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory

记忆传染:通过智能体记忆的评估者偏见的跨时间传播

Zewen Liu

机构 * Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大型语言模型智能体记忆中评估者偏见通过记忆存储跨时间传播的现象,发现即使完美记忆整合也会导致偏见传播,且无安全阈值。

Comments 12 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29247 2026-06-18 cs.CL cs.AI cs.LG 版本更新 83%

MemRerank: Preference Memory for Personalized Product Reranking

MemRerank:用于个性化产品重排序的偏好记忆

Zhiyuan Peng, Xuyang Wu, Huaixiao Tou, Yi Fang, Yu Gong

机构 * Santa Clara University(圣克拉拉大学) Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MemRerank框架,通过强化学习将用户购买历史提炼为查询无关的偏好记忆,用于LLM购物代理的个性化重排序,在1-in-5选择任务中准确率提升高达10.61个百分点。

Comments correct author name in metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18421 2026-06-16 cs.CL cs.AI cs.LG 版本更新 83%

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

EvoMemBench: 从自演化视角评估智能体记忆

Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Createlink Technology(创-link科技) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute of Technology(北京理工大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EvoMemBench,从自演化视角评估智能体记忆,通过内存范围和内容两个维度构建统一基准,比较15种内存方法并发现当前内存系统尚未达到通用解决方案,长上下文基线仍具竞争力,内存在上下文不足或任务困难时效果显著,检索方法在知识密集型任务中表现优异,而程序和长期记忆方法在任务结构匹配时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00061 2026-06-02 q-fin.ST q-fin.TR 83%

Reflexivity as Prompt: Does Awareness of Self-Reinforcing Market Dynamics Improve LLMs as Financial Market Forecasters?

反身性作为提示:对自我强化市场动态的认知是否提高了LLM作为金融市场预测者的表现?

Eugene Park

专题命中 长上下文与记忆 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究在繁荣-萧条市场周期中,逐步引入索罗斯反身性理论时,前沿大语言模型作为金融预测者的行为变化,通过方向性预测准确率和夏普比率评估,发现反身性认知在不同模型和上下文窗口中产生不同的预测改进。

详情

展开后加载摘要…

URL PDF HTML 收藏