arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-25 至 2025-12-25 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 7 篇

2512.20662 2025-12-25 cs.AI 89%

Quantifying Laziness, Decoding Suboptimality, and Context Degradation in Large Language Models

量化懒惰、解码亚优性和上下文退化现象于大语言模型

Yiqing Ma, Jung-Hua Liu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究量化了大语言模型在多部分指令中的懒惰、解码亚优性和上下文退化现象,发现模型在简单任务中表现稳健,但需通过自我完善和动态提示提升指令合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21280 2025-12-25 cs.CL cs.AI 89%

SMART SLM: Structured Memory and Reasoning Transformer, A Small Language Model for Accurate Document Assistance

SMART SLM:结构记忆与推理变换器,一种用于准确文档辅助的小语言模型

Divij Dudeja, Mayukha Pal

机构 * ABB Ability Innovation Center(ABB能力创新中心) Indian Institute of Information Technology(印度信息科技学院)

专题命中 长上下文与记忆 :language model(title);small language model(title);SLM(title);分类 cs.CL、cs.AI

AI总结 SMART SLM通过结构化记忆与推理变换器,提升工程文档处理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00675 2025-12-25 cs.CL 85%

Rethinking Memory in LLM based Agents: Representations, Operations, and Emerging Topics

重新思考基于大语言模型的智能体中的记忆:表示、操作与新兴主题

Yiming Du, Wenyu Huang, Danna Zheng, Zhaowei Wang, Sebastien Montella, Mirella Lapata, Kam-Fai Wong, Jeff Z. Pan

机构 * The Chinese University of Hong Kong Hong Kong China The University of Edinburgh Edinburgh UK The Hong Kong University of Science Huawei Technologies Research \& Development (UK) Limited Edinburgh UK The Chinese University of Hong Kong The University of Edinburgh Huawei Technologies Research \& Development (UK) Limited

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于大语言模型的智能体中记忆的分类框架,涵盖参数型与上下文型记忆,定义六个核心操作,并揭示四个关键研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20986 2025-12-25 cs.CR 85%

AegisAgent: An Autonomous Defense Agent Against Prompt Injection Attacks in LLM-HARs

AegisAgent:一种对抗LLM-HAR中提示注入攻击的自主防御代理

Yihan Wang, Huanqi Yang, Shantanu Pal, Weitao Xu

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 AegisAgent通过自主推理和验证机制,有效降低LLM-HAR系统中提示注入攻击的成功率,提升系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20920 2025-12-25 cs.LG cs.AI 73%

RevFFN: Memory-Efficient Full-Parameter Fine-Tuning of Mixture-of-Experts LLMs with Reversible Blocks

RevFFN: 一种内存高效的混合专家语言模型全参数微调方法,采用可逆块

Ningyuan Liu, Jing Yang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RevFFN通过可逆Transformer块实现混合专家语言模型的高效全参数微调,减少内存消耗,提升训练效率。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14856 2025-12-25 cs.CL 70%

T5Gemma 2: Seeing, Reading, and Understanding Longer

T5Gemma 2: 视觉、阅读与理解更长内容

Biao Zhang, Paul Suganthan, Gaël Liu, Ilya Philippov, Sahil Dua, Ben Hora, Kat Black, Gus Martins, Omar Sanseviero, Shreya Pathak, Cassidy Hardin, Francesco Visin, Jiageng Zhang, Kathleen Kenealy, Qin Yin, Xiaodan Song, Olivier Lacombe, Armand Joulin, Tris Warkentin, Adam Roberts

机构 * Google(谷歌)

专题命中 长上下文与记忆 :pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 T5Gemma 2通过改进的编码器-解码器架构,实现了多模态和长上下文处理能力,同时在预训练和微调性能上优于Gemma 3。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12491 2025-12-25 cs.CL 70%

CAKE: Cascading and Adaptive KV Cache Eviction with Layer Preferences

CAKE:基于层优先级的级联和自适应KV缓存淘汰

Ziran Qin, Yuchen Cao, Mingbao Lin, Wen Hu, Shixuan Fan, Ke Cheng, Weiyao Lin, Jianguo Li

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CAKE通过级联和自适应机制优化KV缓存淘汰,提升低内存下的模型性能和解码效率。

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏