arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2607.26637 2026-07-30 cs.CL cs.AI 新提交 90%

Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

面向LLM智能体的基于文件系统的内存:组织、演化与可持续性

Sizhe Zhou, Sheldon Yu, Hui Wei, Junda Wu, Siru Ouyang, Yizhu Jiao, Shijia Pan, Julian McAuley, Yu Zhang, Tong Yu, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Merced(加利福尼亚大学默塞德分校) Adobe Research(奥多比研究院) Texas A&M University(德克萨斯农工大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究首次系统探索面向LLM智能体的基于文件系统的内存,定义三个智能体角色开展实验,发现有组织存储可减半检索成本,但多数智能体组织会退化,工具集对存储形态的影响与更换模型相当,将文件系统设为智能体内存的设计空间。

Comments 59 pages, 12 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00821 2026-07-23 cs.AI cs.CL cs.IR 版本更新 90%

Fidelity Before Structure: Verbatim Chunks Beat Lossy Artifact Extraction in Long-Conversation LLM Memory

逐字块胜过提取的人工制品:长LLM对话中记忆表征的控制消融研究

Tao An

机构 * Hawaii Pacific University(夏威夷太平洋大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过控制消融实验,发现逐字对话块在长对话记忆检索中比LLM提取的结构化人工制品(事实、决策等)准确率高15.9-22.0点,原因是提取过程丢失了逐字细节,而结构化记忆应作为逐字文本的补充而非替代。

Comments v4: title and abstract aligned with ARR August 2026 submission; six confound controls; 34 pages, 6 figures. Code: https://github.com/tao-hpu/cog-canvas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12233 2026-07-15 cs.CL cs.AI 新提交 90%

Fin-Analyst at FinMMEval 2026 Task 3: A Live Hybrid Trading Agent with LLM Specialists and Rule-Based Signals

2026年金融市场评估任务3中的金融分析师:一个结合大型语言模型专家和基于规则信号的实时混合交易代理

Mohotarema Rashid, Lingzi Hong, Junhua Ding, K. S. M. Tozammel Hossain

机构 * University of North Texas(北德克萨斯大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对金融市场评估任务3,提出结合LLM专家和规则信号的混合交易代理Fin-Analyst,用于特斯拉和比特币交易。通过多源信息聚合及规则投票,在特斯拉交易上取得高回报率,比特币交易表现良好,还分析了排名逆转原因及信号影响等,为后续模型改进提供依据。

Comments 14 pages, 7 tables, 1 figure. CLEF 2026 FinMMEval Task 3 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00233 2026-07-02 cs.AI cs.CL cs.IT cs.MA math.IT 新提交 90%

From Signals to Structure: How Memory Architecture Drives Language Emergence in LLM Agents

从信号到结构:记忆架构如何驱动LLM代理中的语言涌现

Yashar Talebirad, Eden Redman, Ali Parsaee, Osmar R. Zaiane

机构 * Alberta Machine Intelligence Institute, University of Alberta(阿尔伯塔大学阿尔伯塔机器智能研究所) Network for Applied Technology(应用技术网络)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究在Lewis信号游戏中,不同记忆架构对LLM代理语言涌现的影响,发现持久私人笔记本架构优于无状态架构,且信道容量过剩比瓶颈更有利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 90%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22953 2026-06-23 cs.AI cs.CL 新提交 90%

Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents

计划不会持久:为什么上下文管理对LLM代理至关重要

Aman Mehta, Anupam Datta

机构 * Snowflake AI Research(Snowflake AI研究)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00026 2026-06-18 cs.CL cs.AI cs.IR 版本更新 90%

ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents

ActMem:弥合LLM代理中记忆检索与推理之间的差距

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yaqin Jin, Yazhong Zhang, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) National Institute of Healthcare Data Science, Nanjing University, China(南京大学健康数据科学国家研究院)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出ActMem框架,通过将非结构化对话历史转化为结构化因果语义图,结合反事实推理和常识补全,实现主动因果推理,显著提升LLM代理在复杂记忆依赖任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12780 2026-06-12 cs.LG cs.CL 新提交 90%

ProPlay: Procedural World Models for Self-Evolving LLM Agents

ProPlay: 用于自我进化LLM智能体的程序化世界模型

Yijun Ma, Zehong Wang, Yiyang Li, Ziming Li, Xiaoguang Guo, Weixiang Sun, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(圣母大学) University of Connecticut(康涅狄格大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出ProPlay程序化世界模型,通过程序级预演和因果过程图,使LLM智能体在部分可观测环境中自我进化,无需外部监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16548 2026-06-12 cs.CR cs.AI cs.CL 版本更新 90%

A Survey on Long-Term Memory Security in LLM Agents: Attacks, Defenses, and Governance Across the Memory Lifecycle

LLM智能体中长期记忆安全综述:跨记忆生命周期的攻击、防御与治理

Zehao Lin, Xixuan Hao, Renyu Fu, Shaobo Cui, Kai Chen, Chunyu Li, Zhiyu Li, Feiyu Xiong

机构 * MemTensor Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出记忆生命周期框架,系统分析LLM智能体长期记忆面临的新威胁,并引入可验证记忆治理(VMG)架构原语,强调存储时溯源与版本控制对安全的关键作用。

Comments 63 pages, 7 figures, 10 tables. Survey paper. Preprint; submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07711 2026-06-09 cs.LG cs.AI 新提交 90%

Rosetta Memory: Adaptive Memory for Cross-LLM Agents

Rosetta Memory: 跨LLM智能体的自适应记忆

Hao Yang, Shiqi Shen, Haoxuan Li, Zhipeng Wang, Zhi Gong, Xu Chen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Weixin, Tencent(腾讯微信) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出记忆中心式LLM自适应方法,通过双轮廓条件算子与最小增益采样课程,解决上游记忆激活下游LLM的跨模型适应问题,在多项QA任务中优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17281 2026-06-04 cs.LG cs.AI cs.IR 90%

MemoryBench: A Benchmark for Memory and Continual Learning in LLM Systems

MemoryBench:面向LLM系统的记忆与持续学习基准

Qingyao Ai, Yichen Tang, Changyue Wang, Jianming Long, Weihang Su, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出用户反馈模拟框架及跨领域、多语言、多任务类型的综合基准MemoryBench,评估LLM系统从累积用户反馈中持续学习的能力,实验表明现有方法效果与效率均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 90%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11243 2026-05-25 cs.LG cs.CL 90%

Evaluating Memory Structure in LLM Agents

评估LLM智能体中的记忆结构

Alina Shutova, Alexandra Olenina, Ivan Vinogradov, Anton Sinitsin

机构 * HSE University(莫斯科国立高等经济学院) Yandex YSDA New Economic School(新经济学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出StructMemEval基准测试,通过结构化记忆任务(如交易账本、待办事项列表、树结构等)评估LLM智能体组织长期记忆的能力,发现简单检索增强LLM难以胜任,而记忆智能体在提示下可解决,但现代LLM在无提示时无法自主识别记忆结构。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22502 2026-05-22 cs.AI cs.LG 90%

Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost

将代理工作流编译为LLM权重:在成本上减少两个数量级的情况下实现接近前沿质量

Simon Dennis, Rivaan Patil, Kevin Shabahang, Hao Guo

机构 * University of Melbourne(墨尔本大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文研究如何将代理工作流编译为LLM权重以提高效率,通过在旅行预订、Zoom支持和保险索赔等任务中验证,展示了编译方法在减少成本的同时保持高质量性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17830 2026-05-19 cs.AI cs.CL 90%

Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

记住更多,风险更多:具有记忆能力的LLM代理的纵向安全风险

Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu, Ruoxi Jia, Ming Jin

机构 * Virginia Tech(弗吉尼亚理工大学) University of California, Berkeley(加州大学伯克利分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究探讨了具有记忆能力的LLM代理在长期任务中因记忆积累导致的安全风险,提出了一种触发-探测协议来评估记忆污染的影响,并发现记忆安全应被视为一个纵向属性而非单一状态属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07122 2026-05-19 cs.CR cs.AI cs.LG 90%

Enhancing Cloud Network Resilience via a Robust LLM-Empowered Multi-Agent Reinforcement Learning Framework

通过一个鲁棒的LLM赋能的多智能体强化学习框架增强云网络韧性

Yixiao Peng, Hao Hu, Feiyang Li, Xinye Cao, Yingchang Jiang, Jipeng Tang, Guoshun Nan, Yuling Liu

机构 * State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Henan Key Laboratory of Information Security(河南省信息安全重点实验室) National Engineering Research Center for Mobile Network Technologies(移动网络技术国家工程研究中心) Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于大语言模型的多智能体强化学习框架,旨在提升云网络的防御能力和韧性,通过分层架构和人类在回路支持来增强系统的适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13941 2026-05-15 cs.LG cs.AI 90%

EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents

EvolveMem:通过AutoResearch实现LLM代理的自进化内存架构

Jiaqi Liu, Xinyu Ye, Peng Xia, Zeyu Zheng, Cihang Xie, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) UCSC(加州大学圣克鲁兹分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出EvolveMem,一种通过AutoResearch实现自进化内存架构的LLM代理系统,通过闭环自进化过程自动优化检索配置,实现存储知识与检索机制的协同进化,实验表明其在多个基准测试中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07076 2026-05-13 cs.CL cs.LG 90%

Self-Consolidating Language Models: Continual Knowledge Incorporation from Context

自持续语言模型:从上下文持续整合知识

Zekun Wang, Anant Gupta, Zihan Dong, Christopher J. MacLellan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);post-training(abstract)

AI总结 本文提出自持续语言模型(SCoL),通过在训练后框架中利用上下文生成更新指令,实现持续知识整合,优于多种基线方法。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07068 2026-05-11 cs.CL cs.AI 90%

WiCER: Wiki-memory Compile, Evaluate, Refine Iterative Knowledge Compilation for LLM Wiki Systems

WiCER:维基内存编译、评估、细化迭代知识编译用于LLM维基系统

Juan M. Huerta

机构 * Zinnia Tech Solutions(Zinnia科技解决方案)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出WiCER算法,通过迭代编译、评估和细化维基内存,解决LLM维基系统中知识编译的差距问题,显著提升知识检索质量并减少灾难性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05716 2026-05-08 cs.AI cs.CL 90%

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

更多并不总是更好:LLM代理构建中的跨组件干扰

Ming Liu

机构 * Amazon(亚马逊)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM代理系统中组件交互导致的性能下降,发现最优组件数量依赖任务和模型规模,贪心选择不可靠,需通过交互分析进行任务特定子集选择。

Comments 10 pages, 5 tables; preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27003 2026-05-01 cs.LG cs.AI 90%

When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents

当持续学习转向记忆:对LLM智能体经验重用的研究

Qisheng Hu, Quanyu Long, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究揭示了内存增强型LLM智能体在持续学习中经验重用的问题,发现记忆检索时旧经验与新经验的竞争加剧了持续学习的瓶颈,提出了(k,v)框架以解耦外部记忆的设计关键要素。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25847 2026-04-29 math.OC cs.AI cs.LG 90%

From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling

从独白到广场:基于去中心化辩论的记忆增强型LLM代理用于优化建模

Jianghao Lin, Zi Ling, Chenyu Zhou, Tianyi Xu, Ruoqing Jiang, Zizhuo Wang, Dongdong Ge

机构 * Antai College of Economics and Management(上海交通大学安泰经济管理学院) University of Chicago Booth School of Business(芝加哥大学布斯商学院) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) School of Economics and Management(清华大学经济管理学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agora-Opt框架,结合去中心化辩论与读写记忆库,实现优化建模的模块化代理系统,通过去中心化辩论协议实现多代理团队的协同优化,提升建模可靠性。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20582 2026-04-23 cs.MA cs.AI cs.CL 90%

Trust, Lies, and Long Memories: Emergent Social Dynamics and Reputation in Multi-Round Avalon with LLM Agents

信任、谎言与长久记忆:在多轮阿瓦隆中的LLM代理涌现的社会动态与声誉

Suveen Ellawela

机构 * National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM代理在多轮阿瓦隆游戏中社会动态与声誉的演变,发现记忆保留促进声誉形成及策略性欺骗,高推理努力提升欺骗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15505 2026-04-20 cs.CL cs.AI 90%

PolicyBank: Evolving Policy Understanding for LLM Agents

PolicyBank: 为LLM代理演化政策理解

Jihye Choi, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister

机构 * Google Cloud(谷歌云) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究通过交互与反馈让LLM代理自主优化政策解读,提出PolicyBank机制以结构化存储政策洞察并迭代完善,有效填补规范缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03174 2026-04-15 cs.CL cs.AI 90%

LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability

LLM作为具有注意力机制的NTM及话题建模作为长输入生成:可解释性与长上下文能力

Xuan Xu, Zhongliang Yang, Haolun Li, Beilin Chu, Rui Tian, Yu Li, Shaolin Tan, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology Beijing(北京科技大学) Beijing Value Simplex Technology Co. Ltd(北京价值简单科技有限公司) Zhongguancun Laboratory(中关村实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文从白盒和黑盒视角研究基于LLM的话题建模,提出注意力引导框架恢复可解释结构,并通过长输入任务和信号补偿方法提升性能,验证LLM与NTM的联系及长上下文LLM在话题建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21843 2025-09-29 cs.CR cs.CL cs.LG 90%

SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models

Jingkai Guo, Chaitali Chakrabarti, Deliang Fan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 4 figures, 5 tables, 2 equations. Topics: Bit-flip attacks, adversarial attacks, large language models (LLMs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06973 2024-10-10 cs.CL cs.AI 90%

Personal Intelligence System UniLM: Hybrid On-Device Small Language Model and Server-Based Large Language Model for Malay Nusantara

Azree Nazri, Olalekan Agbolade, Faisal Aziz

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);small language model(title);分类 cs.CL、cs.AI

Comments 20 pages, 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06007 2026-08-07 cs.DC 新提交 90%

TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure

TensorCast:大语言模型基础设施中缺失的张量管理层

Yuhan Zhou, Yuchu Luo, Hao Nie, Wangrunze Lv, Yu Zhou, Yibo Zhu, Daxin Jiang, Chenren Xu

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title);language model(title)

AI总结 该研究针对LLM基础设施中张量管理策略复用受阻的问题,提出TensorCast分布式张量管理层,将张量状态管理与计算逻辑解耦,在保持性能的同时提升多轮智能体工作负载的TTFT达93.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13428 2026-06-02 cs.CL cs.AI cs.LG 90%

Softplus Attention with Re-weighting Boosts Length Extrapolation in Large Language Models

Softplus注意力与重加权提升大语言模型的长度外推能力

Bo Gao, Michael W. Spratling, Letizia Gionfrida

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种两阶段注意力机制,用Softplus和l1归一化替代Softmax,并引入基于不变熵的动态缩放因子和重加权机制,以提升数值稳定性、缓解注意力下沉现象,并显著改善长度外推性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10027 2026-05-19 cs.CV 90%

SinkTrack: Attention Sink based Context Anchoring for Large Language Models

SinkTrack: 基于注意力sink的上下文锚定用于大语言模型

Xu Liu, Guikun Chen, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 SinkTrack通过将<BOS>作为信息锚点,注入关键上下文特征,缓解大语言模型的幻觉和上下文遗忘问题,实验显示在文本和多模态任务中均取得显著提升。

Comments ICLR 2026. Code: https://github.com/67L1/SinkTrack

详情

展开后加载摘要…

URL PDF HTML 收藏