arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 26 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 26 篇

2608.29606 2026-09-01 cs.CL 新提交 91%

Agent Zero Memory: Provenance-Aware Long-Term Memory for LLM Agents

Agent Zero Memory:面向大语言模型智能体的溯源感知长期记忆系统

Ming Wu, Pengyuan Zhu

机构 * Zero Labs(零实验室)

专题命中 记忆与上下文管理 :agent(title,title_cn);agentic(abstract);分类 cs.CL

AI总结 该研究提出Agent Zero Memory系统,采用三个并行记忆架构,通过溯源规则杜绝幻觉,在LongMemEval和LoCoMo基准上取得最优性能,且成本-效率表现优异。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29716 2026-09-01 cs.SE 新提交 85%

Agent-Driven Verification of Memory Safety for liblzma Decoder Components with VST

基于VST的Agent驱动liblzma解码器组件内存安全验证

Prokhor Shlyakhtun, Alexander Gryzlov, Vladimir Kukharenko, Vasilii Nesterov, Nikolai Vasiliev, Kirill Ziborov, Eugene Zolotarev, Alex Pokras

专题命中 记忆与上下文管理 :agent(title,title_cn);AI agent(abstract);分类 cs.SE

AI总结 该研究基于VST,通过AI智能体辅助验证了liblzma生产级C解码器组件的内存安全,发现了其中的未定义行为,并解决了智能体驱动形式化验证的相关工程问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22215 2026-09-01 cs.CL 版本更新 85%

Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation

带有快速写入路由与慢速整合的双层智能体记忆

Wenzhi Li, Dong Nie, Rui Lan, Tongtong Lyu, Peiyao Wang, Lingzi Hong, Weihang Pan, Binbin Lin, Boyuan Pan, Yao Hu

机构 * Zhejiang University(浙江大学) Xiaohongshu(小红书) University of North Texas(北得克萨斯大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 该研究针对LLM智能体动态环境下的记忆管理问题,提出双层智能体记忆框架,通过成本感知路由与周期性整合实现高效记忆处理,在保留高检索性能的同时减少冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31022 2026-09-01 cs.AI cs.CV 新提交 83%

MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents

MNIST-PRO:MNIST作为AI智能体的部分可观测世界回归

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 记忆与上下文管理 :AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出MNIST-PRO基准,将MNIST数字识别转化为带回溯约束的顺序搜索任务,评估多模态模型在部分可观测性下的表现,发现智能体存在感知整合、探索持续性及信念修正三大瓶颈,凸显构建更新可靠感知状态的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05107 2026-09-01 cs.AI 版本更新 83%

Controllable Memory Usage: Balancing Anchoring and Innovation in Long-Term Human-Agent Interaction

可控的记忆使用:在长期人机交互中平衡锚定与创新

Muzhao Tian, Zisu Huang, Xiaohua Wang, Jingwen Xu, Zhengkang Guo, Qi Qian, Yuanzhe Shen, Kaitao Song, Jiakang Yuan, Changze Lv, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 SteeM通过动态调节记忆依赖程度,在长期人机交互中平衡锚定与创新,提升个性化协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21545 2026-09-01 cs.AI cs.CL 版本更新 81%

ShardMemo: Scope-Before-Routing for Agentic Memory Retrieval

ShardMemo: 用于分片代理LLM内存的遮蔽MoE路由

Yang Zhao, Chengxiao Dai, Mengying Kou, Yue Xiu, Dusit Niyato

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 ShardMemo通过遮蔽MoE路由优化分片代理LLM内存,提升F1分数并减少检索工作和延迟

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31057 2026-09-01 cs.AI 新提交 79%

Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents

先测量再管理:评估编码智能体的工作记忆

Le Chen, Zishen Wan, Baixi Sun, Xiaolong Ma, Chih-Hsuan Yang, Feng Yan, Sheng Di, Franck Cappello, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Columbia University(哥伦比亚大学) University of Houston(休斯顿大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对编码智能体工作记忆的语义异质性,提出两种语义感知记忆管理策略,发现校准增益难迁移、相同token预算效果不同等问题,表明评估记忆管理策略需考虑更多维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30177 2026-09-01 cs.CR 新提交 78%

Understanding Stage-Wise Utility-Risk Trade-offs in LLM Agent Memory

理解LLM智能体记忆中的阶段式效用-风险权衡

Chuanchao Zang, Zijian Cao, Xiangtao Meng, Jianing Wang, Wenyu Chen, Xinyu Gao, Li Wang, Zheng Li, Shanqing Guo

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 本文提出可控框架\textsc{MemGauge},在11个LLM和两个记忆基准上揭示LLM智能体记忆各阶段的效用-风险权衡特征,为阶段感知评估与控制提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29181 2026-09-01 cs.LG cs.AI cs.CV 版本更新 73%

SERUM: State Extraction and Refinement for User Modeling

SERUM:面向用户建模的状态提取与优化

Andy J. Phu, Karin de Langis, James Mooney, Khanh Chi Le, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 记忆与上下文管理 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 SERUM是首个无需人工标注即可从非结构化自我中心屏幕视频生成可解释过程模型的多阶段框架,经61段跨领域视频验证,其优化后的标签在马尔可夫模型预测与人工评估中均表现优异,为用户建模提供了可扩展方案。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30478 2026-09-01 cs.CL 新提交 70%

Agents in the Large: Perception-Centered Architecture for Persistent Agents

大型智能体:面向持久智能体的感知中心架构

Shihan Dou, Haoxiang Jia, Shichun Liu, Feng Chen, Chenhao Huang, Yujiong Shen, Shaofan Liu, Jiayi Chen, Jiahang Lin, Honglin Guo, Qianyu He, Minghao Guo, Ziyi Ye, Pluto Zhou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 该研究提出面向持久智能体的感知中心架构(Pera),用于刻画、组织和指导持久AI智能体的发展,类比软件工程的小型到大型编程,推动语言智能体向长期自适应智能系统演进。

Comments 41 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29528 2026-09-01 cs.LG cs.DC cs.MA 新提交 70%

MedCache: Efficient and Temporally Valid Memory for Longitudinal Clinical Agents

MedCache:面向纵向临床智能体的高效且具备时间有效性的记忆机制

Hei Ting (Una) Chan, Chenwei Wu, Xueshen Liu, Boyuan Zheng, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文针对纵向临床智能体的记忆设计问题,提出MedCache混合框架,经实验验证其可提升临床推理准确率与记忆效率,且具备跨模型骨干及外部数据集的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12978 2026-09-01 cs.AI 版本更新 70%

Useful Memories Become Faulty When Continuously Updated by LLMs

有用的记忆在由LLMs持续更新时会变得错误

Dylan Zhang, Yanshan Lin, Zhengkun Wu, Yihang Sun, Bingxuan Li, Dianqi Li, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IIIS, Tsinghua University(清华大学人工智能研究院)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究发现,即使基于有用经验,LLM生成的记忆在持续更新后可能失效,建议将原始事件作为首要证据并明确控制记忆巩固过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06973 2026-09-01 cs.CL 版本更新 70%

LLMs Can't Play Hangman: On the Necessity of a Private Working Memory for Language Agents

LLMs无法玩井字游戏:关于语言代理所需私人工作记忆的必要性

Davide Baldelli, Ali Parviz, Amal Zouaq, Sarath Chandar

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔大学) University of California, San Diego(加州大学圣地亚哥分校) LAMA-WeST Lab(LAMA-WeST实验室) Chandar Research Lab(Chandar研究实验室)

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文提出私人状态交互任务(PSITs)并证明标准LLMs无法在交互任务中保持秘密和一致性,提出包含显式私人工作记忆的架构以恢复一致性。

Comments Accepted at the Conference on Lifelong Learning Agents (CoLLAs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30830 2026-09-01 cs.OS 新提交 67%

Adaptive KV Retention for LLM Agents at Human-Approval Timescales

面向人类审批 timescale 的大语言模型智能体的自适应 KV 保留机制

Minseo Choi, Ananya Joshi

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)

AI总结 针对 LLM 智能体等待人类审批的长时间暂停问题,提出分层保留控制器,在平衡 KV 保留与驱逐的成本下,显著提升活跃请求的有效吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28609 2026-09-01 cs.CL cs.AI cs.CV 新提交 62%

Parametric Multimodal User Memory: Storing What Captions Cannot Carry

参数化多模态用户记忆:存储字幕无法承载的内容

Bojie Li, Noah Shi

机构 * Pine AI(派恩人工智能) University of Washington(华盛顿大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出参数化多模态用户记忆,结合视觉语言模型与专用编码器,解决传统文本用户记忆丢失感知信息的问题,在PerceptMem数据集上验证了其有效性与可推广性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15071 2026-09-01 cs.AI cs.CL 版本更新 62%

Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

Evo-Harness:面向自进化智能体的上下文到 harness 的技能编译

Tianxin Wei, Zhan Shi, Minhua Lin, Bing He, Zewen Liu, Yisi Sang, Yuanchen Bei, Xuying Ning, Jiaru Zou, Ting-Wei Li, Xiao Lin, Yanjun Zhao, Chi Wang, Benoit Dumoulin, Dakuo Wang, Jingrui He, Hanqing Lu

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对现有自进化 LLM 智能体方法的不足,提出 Evo-Harness 框架,通过上下文到 harness 的技能编译提炼单次执行的噪声上下文,在五个现实基准上验证了其有效性,为 LLM 智能体即时学习提供了原则性理解。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-09-01 cs.CL cs.AI 版本更新 62%

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

机构 * Google Research(谷歌研究院) CNRS(法国国家科学研究中心) IRIF(法国信息学研究所) Université Paris-Cité(巴黎城市大学) Princeton University(普林斯顿大学) Université Paris-Saclay(巴黎萨克雷大学) CEA(法国原子能和替代能源委员会) California Institute of Technology(加州理工学院) Google DeepMind(谷歌DeepMind)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27499 2026-09-01 cs.CV cs.AI cs.CL 版本更新 62%

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

DMV-Bench: 通过偶然线索注入诊断长程多模态智能体的视觉记忆

Yujin Tang, Chenming Shang, Ruize Xu, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出首个交互式多模态智能体视觉记忆基准DMV-Bench,基于双编码理论设计DualMem架构,在长链任务中优于现有方法。

Comments Accepted to EMNLP 2026 Main Conference. 17 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18272 2026-09-01 cs.AI cs.CL 版本更新 62%

Retrieval-Augmented LLM Agents: Learning to Learn from Experience

基于检索的LLM代理:学习从经验中学习

Thomas Palmeira Ferraz, Romain Deffayet, Vassilina Nikoulina, Hervé Déjean, Stéphane Clinchant

机构 * NAVER LABS Europe(NAVER实验室欧洲)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出结合微调与经验检索的方法,通过LoRA优化SFT流程,分析经验检索关键设计,提出整合经验检索的训练流程,提升代理对新任务的泛化能力。

Comments Accepted at EMNLP 2026 - Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30877 2026-09-01 cs.LG 新提交 57%

Deploying DeepSeek 175B Locally on a Single Consumer-Grade RTX 4060 Laptop with 32GB RAM for 200k-Scale Protein-Ligand Virtual Screening

在配备32GB内存的单台消费级RTX 4060笔记本电脑上本地部署DeepSeek 175B,开展20万规模的蛋白-配体虚拟筛选

Rui Xiao, Yili Xu

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.LG

AI总结 本研究提出低资源框架,在单台消费级RTX 4060笔记本本地部署DeepSeek 175B,完成20万规模蛋白-配体虚拟筛选,满足药物发现精度要求,为早期药物发现建立低门槛范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30094 2026-09-01 cs.CV cs.LG 新提交 57%

A Hybrid State-Space Approach for Census-Tract Population Estimation

一种用于普查 tract 人口估算的混合状态空间方法

Jackson R. Ye, Alexandre V. Morozov

机构 * Rutgers University(罗格斯大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 本研究提出 MambaPop 方法,将行政单元卫星图像作为序列建模输入,直接估算人口,消除分解步骤,在 8.4 万个美国本土普查 tract 上达到与 YOLOv11 相当的 MAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29860 2026-09-01 cs.LG 新提交 57%

Uncertainty-Driven Replay Memory for Reinforcement Learning

强化学习中基于不确定性驱动的回放记忆

Sheeraja Rajakrishnan, Alexander G. Ororbia, Travis Desell, Daniel E. Krutz

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本研究提出一种名为不确定性驱动的回放记忆(UDRM)的经验回放缓冲区,通过基于不确定性估计更新存储的记忆,使RL智能体在训练中获得更高奖励、提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29537 2026-09-01 cs.RO cs.AI 新提交 57%

AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies

AGM:基于成就的闭环智能体记忆,适用于冻结的视觉-语言-动作(VLA)策略

Hongbo Gao, Zeyu Ni, Xin Wen, Siyu Xu, Ruifeng Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Sydney(悉尼大学) StellarEdge AI(星边人工智能)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 针对冻结VLA策略无法跟踪任务进度的问题,提出AGM框架,通过物理证据验证子目标实现闭环,在RoboMME基准和物理机器人上均取得显著性能提升。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28978 2026-09-01 cs.AI 新提交 57%

Selective Forgetting: A Graph-Based Memory Framework for Long-Term LLM Agents

选择性遗忘:面向长期大语言模型智能体的基于图的记忆框架

Theo Rusu, Sourena Khanzadeh, Manar Alalfi

机构 * Toronto Metropolitan University(多伦多都会大学) The Creative School(创意学院) Flybits(弗莱比特公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本研究评估了基于图的长期LLM智能体记忆框架的假设,发现其在LongMemEval上未优于扁平向量基线,但遗忘模块能高效剪枝节点且性能损失小,结果受提取器和单一基准限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16690 2026-09-01 cs.CL cs.CV 版本更新 57%

EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

EMemBench: 交互式评估VLM代理情景记忆的基准测试

Xinze Li, Ziyue Zhu, Siyuan Liu, Yubo Ma, Yuhang Zang, Yixin Cao, Aixin Sun

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 EMemBench通过交互式游戏评估VLM代理的情景记忆,发现归纳和空间推理在视觉设置中仍是瓶颈,且持续记忆对文本游戏有明显提升,但对VLM代理的提升不一致。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28644 2026-09-01 physics.soc-ph cs.MA cs.SI 新提交 50%

Measuring Collective Semantic Change in Populations of Language Model Agents

测量语言模型智能体群体中的集体语义变化

Elena Kopteva

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本研究提出名为Kopterix的被动纵向工具,在智能体社交平台Moltbook上验证其可测量语言模型智能体群体的集体语义变化,从词汇、几何、时间层面分析语义变化特征,为相关研究提供可复用的观测方案。

Comments 43 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏