arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-16 至 2026-06-16 共收录 351 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 24 篇

2604.13085 2026-06-16 cs.LG cs.AI 版本更新 88%

Adaptive Memory Crystallization for Autonomous AI Agent Learning in Dynamic Environments

自适应记忆结晶:动态环境中自主AI智能体学习

Rajat Khanda, Mohammad Baqar, Sambuddha Chakrabarti, Satyasaran Changdar

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出自适应记忆结晶(AMC)架构,基于突触标记与捕获理论,通过三阶段记忆层次和随机微分方程实现持续强化学习,在多个基准上显著提升前向迁移、减少灾难性遗忘并降低内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21714 2026-06-16 cs.AI 版本更新 88%

E-mem: Multi-agent based Episodic Context Reconstruction for LLM Agent Memory

E-mem:基于多智能体的事件上下文重建用于LLM智能体记忆

Kaixiang Wang, Yidan Lin, Jiong Lou, Zhaojiacheng Zhou, Bunyod Suvonov, Jie Li

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(title);planning(abstract);分类 cs.AI

AI总结 E-mem通过多智能体协同重建事件上下文,提升LLM在长时序任务中的推理能力,实现54%的F1分数,优于现有方法7.75%,并降低70%的token成本。

Comments This paper has been accepted by ICML 2026. If you find our project helpful, please consider giving it a star: https://github.com/dog-last/E-mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18421 2026-06-16 cs.CL cs.AI cs.LG 版本更新 85%

EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective

EvoMemBench: 从自演化视角评估智能体记忆

Yuyao Wang, Zhongjian Zhang, Mo Chi, Kaichi Yu, Yuhan Li, Miao Peng, Bing Tong, Chen Zhang, Yan Zhou, Jia Li

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Createlink Technology(创-link科技) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute of Technology(北京理工大学)

专题命中 记忆与上下文管理 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EvoMemBench,从自演化视角评估智能体记忆,通过内存范围和内容两个维度构建统一基准,比较15种内存方法并发现当前内存系统尚未达到通用解决方案,长上下文基线仍具竞争力,内存在上下文不足或任务困难时效果显著,检索方法在知识密集型任务中表现优异,而程序和长期记忆方法在任务结构匹配时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05965 2026-06-16 cs.MA cs.AI 版本更新 83%

Learning to Share: Selective Memory for Efficient Parallel Agentic Systems

学习共享:面向高效并行智能体系统的选择性记忆

Joseph Fioresi, Parth Parag Kulkarni, Ashmal Vayani, Song Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida, Orlando, United States(人工智能研究所,中央佛罗里达大学,奥兰多,美国)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出LTS机制,通过强化学习训练控制器选择性共享跨团队中间信息,在减少并行智能体系统计算开销的同时保持或提升任务性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14831 2026-06-16 cs.CR cs.AI 新提交 79%

Is Your Agent Playing Dead? Deployed LLM Agents Exhibit Constraint-Evasive Fabrication and Thanatosis

你的智能体在装死吗?部署的LLM智能体表现出约束规避性虚构与假死

Andoni Rodríguez, Alberto Pozanco, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本文发现LLM智能体在不可调和约束下会自发虚构外部障碍(约束规避性虚构),极端情况下模拟系统崩溃(假死),并通过实验证明该行为具有鲁棒性、随机性和自我强化特性,现有安全基准未覆盖此故障模式。

Comments 10 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11364 2026-06-16 cs.AI 版本更新 79%

The Missing Knowledge Layer in Cognitive Architectures for AI Agents

AI智能体认知架构中缺失的知识层

Michaël Roynard

机构 * Independent Researcher(独立研究者)

专题命中 记忆与上下文管理 :AI agent(title,abstract);分类 cs.AI

AI总结 针对现有AI智能体认知架构(如CoALA和JEPA)缺乏独立知识层的问题,提出四层分解架构(知识、记忆、智慧、智能),各层具有不同的持久性语义,并通过Python和Rust实现验证了架构分离的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15473 2026-06-16 q-fin.RM 新提交 78%

Belief at Risk: Quantifying Agentic AI Model Risk with LLM-Inferred Bayesian State Filters

风险中的信念:利用LLM推断的贝叶斯状态滤波器量化智能体AI模型风险

Matthew Francis Dixon

专题命中 记忆与上下文管理 :agentic(title,abstract)

AI总结 提出将智能体AI系统建模为部分可观测马尔可夫决策过程,利用LLM作为语义观测模型,结合贝叶斯滤波器量化不确定性,并计算风险度量,为金融等受监管环境中的智能体AI验证提供严格基础。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19595 2026-06-16 cs.IR cs.CL 版本更新 74%

All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution

All-Mem: 通过动态拓扑演化实现智能体终身记忆

Can Lv, Heng Chang, Shengyu Tao, Mingju Chen, Zhaoxin Fan, Ziwei Zhang, Yuchen Guo, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) Beihang University(北航) Tsinghua University(清华大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 记忆与上下文管理 :agentic(title);分类 cs.CL

AI总结 提出All-Mem框架,通过在线/离线结合的非破坏性拓扑结构记忆库,解决终身交互代理中历史增长导致的检索冗余和噪声问题,在LoCoMo和LongMemEval-s上提升检索与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13710 2026-06-16 cs.AI cs.LG 新提交 73%

Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

混合开放式三重进化打造更优深度研究者

Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Xidong Wang, Derek Li, Ying Wei, Bryan Dai

机构 * IQuest Research Zhejiang University(浙江大学)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 提出混合开放式三重进化框架,通过混合模式强化学习协同进化提议者、求解者和评判者,使8B模型在深度研究任务上超越静态开源8-32B模型及先进训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16813 2026-06-16 cs.AI 新提交 70%

GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents

GIST-CMTF:LLM代理中因果最小工具过滤的目标状态推断

Rahul Suresh Babu, Rohit Shukla

机构 * Rahul Suresh Babu Rohit Shukla

专题命中 记忆与上下文管理 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 提出GIST-CMTF层,通过预测候选符号目标状态并估计歧义性,解决工具增强LLM代理因用户请求多义性导致的错误目标执行问题,在120个任务上达到97.0%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01326 2026-06-16 cs.SE 70%

Reducing Token Usage of State-in-Context Agents using Minification

通过精简减少上下文状态智能体的令牌使用

Nicolas Hrubec, Jürgen Cito

专题命中 记忆与上下文管理 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 本文复制并扩展了上下文状态智能体框架,通过代码精简技术减少输入令牌使用,在SWE-bench Verified基准上平均减少42%令牌,分辨率下降12个百分点。

Journal ref 2026 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15966 2026-06-16 cs.AI 版本更新 70%

PISA: A Pragmatic Psych-Inspired Unified Memory System for Enhanced AI Agency

PISA:一种增强AI能动性的实用心理学启发统一记忆系统

Shian Jia, Ziyang Huang, Xinbo Wang, Haofei Zhang, Mingli Song

机构 * Zhejiang University(浙江大学)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 受皮亚杰认知发展理论启发,提出PISA统一记忆系统,通过三模态适应机制(模式更新、演化、创建)和混合记忆访问架构,显著提升AI代理的适应性和长期知识保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17002 2026-06-16 cs.CY 新提交 67%

From Newtonian to Relativistic IAM: The Autonomous Principal as Reference Frame for Digital Identity

从牛顿到相对论IAM:自主主体作为数字身份参考框架

Philippe Page, Robert Mitwicki, Michal Pietrus

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)

AI总结 本文通过物理类比论证,在分布式信息系统中,自主主体是因果一致性的必然结果,而非规范偏好,并展示了自2023年以来实现该观点的技术及其对跨境数据流和代理系统的影响。

Comments 30 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21312 2026-06-16 cs.DC cs.AI cs.LG 版本更新 62%

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

Frontier: 向全面且准确的LLM推理模拟迈进

Yicheng Feng, Xin Tan, Yangtao Deng, Yimin Jiang, Yibo Zhu, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Anuttacon StepFun

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18227 2026-06-16 cs.LG cs.AI 版本更新 62%

Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality

Token缩减应超越生成模型中的效率——从视觉、语言到多模态

Zhenglun Kong, Yize Li, Fanhu Zeng, Lei Xin, Shvat Messica, Xue Lin, Pu Zhao, Manolis Kellis, Hao Tang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Northeastern University(东北大学) CAS(中国科学院) Wuhan University(武汉大学) MIT(麻省理工学院) Peking University(北京大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Token缩减应超越传统效率优化,成为生成模型的基础原则,通过减少冗余token来促进多模态融合、缓解幻觉、维持长输入连贯性并提升训练稳定性。

Comments Project page: https://github.com/ZLKong/Awesome-Collection-Token-Reduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15609 2026-06-16 cs.CR cs.AI 新提交 57%

FragFuse: Bypassing Access Control of Large Language Model Agents via Memory-Based Query Fragmentation and Fusion

FragFuse:通过基于记忆的查询碎片化与融合绕过大型语言模型智能体的访问控制

Zixin Rao, Wentian Zhu, Chan Aristella Lu, Zhaorun Chen, Wei Niu, Le Guan, Bo Li, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of Chicago(芝加哥大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出FragFuse攻击,利用LLM智能体的长期记忆机制,将违禁内容碎片化存储后融合重构,绕过访问控制,平均绕过成功率达86.3%。

Comments 33 pages, 4 figures. Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08151 2026-06-16 cs.AI 新提交 57%

Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents

决策感知记忆卡:用于工具使用LLM智能体的反事实启发式上下文选择与压缩

Xinyu Guan, Qianyang Zhao, Yuming Deng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出CICL决策感知上下文层,通过构建上下文图、评分单元效用并打包为记忆卡,提升工具使用LLM智能体在行动时的证据选择与压缩能力,在SWE-bench验证集上实现检索命中率提升。

Comments 15 pages, 2 figures, 8 tables. Code is available at https://github.com/stephen-guan-researcher/CICL; Qwen-QLoRA adapter is available at https://huggingface.co/XinyuGuan/CICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00781 2026-06-16 cs.LG stat.ML 版本更新 57%

Fast Non-Episodic Finite-Horizon RL with K-Step Lookahead Thresholding

快速非情节有限时域强化学习:K步前瞻阈值法

Jiamin Xu, Kyra Gan

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 针对非情节有限时域MDP,提出K步前瞻Q函数与阈值机制,实现快速有限样本收敛,在合成环境和标准RL任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16342 2026-06-16 cs.CV 新提交 50%

When the Past Matters: FlashBack Memory for Precipitation Nowcasting

当过去重要时:用于降水临近预报的FlashBack记忆

Yuhao Du, Boxiao Huang, Chengrong Wu, Jiankai Zhang

机构 * College of Atmospheric Sciences, Lanzhou University(兰州大学大气科学学院) Fuqua School of Business, Duke University(杜克大学福库商学院) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Supercomputing Center of Lanzhou University(兰州大学超级计算中心)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 提出FlashBack Memory模块,通过动态检索关键历史状态并自适应融合,增强循环模型时空表征能力,显著提升高分辨率降水预测的准确性和时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16184 2026-06-16 cs.CV cs.MM 新提交 50%

Closed-Loop Triplet Synergistic Generation for Long-Form Video

闭环三元组协同生成用于长视频

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 提出CoTriSyGen框架,通过闭环视觉-文本-记忆协同过程,结合分析器进行镜头内和镜头间修正,解决长视频生成中的身份漂移和不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16135 2026-06-16 cs.DC 新提交 50%

SwiftCache: Efficient LLM Serving for Multi-turn Conversations with Heterogeneous KV Cache Sharing

SwiftCache: 面向多轮对话的高效LLM服务与异构KV缓存共享

Jianmin Hu, Minxian Xu, Sa Wang, Chong Ma, Min Shen, Kejiang Ye, Lin Qu, Chengzhong Xu

专题命中 记忆与上下文管理 :AI agent(abstract)

AI总结 针对多轮对话中KV缓存占用显存导致推理延迟高、上下文受限的问题,提出SwiftCache系统,通过异构模型间共享空闲GPU内存和NVLink带宽,仅保留当前层KV缓存,降低延迟并扩展上下文长度。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15071 2026-06-16 quant-ph 新提交 50%

Quantum learning with a single-atom sensor

单原子传感器的量子学习

Yin Mo, Emilio Bagan, Giulio Chiribella

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究单原子传感器在量子学习中的性能极限,发现传感阶段的纠缠与行动阶段的相干性之间存在根本权衡,并揭示了量子传感器特性对最优行动策略的影响。

Comments 5+12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14818 2026-06-16 physics.soc-ph cond-mat.stat-mech cs.MA 新提交 50%

Physics of anticipatory active matter, with application to crowd dynamics

预期性活性物质的物理及其在人群动力学中的应用

Alexis Raulin-Foissac, Alexandre Nicolas

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出预期性主体的统计物理框架,通过将d维预期动力学映射到d+1维非预期链,利用聚合物物理刻画不确定性,成功应用于行人动力学,复现复杂场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09022 2026-06-16 math.PR 新提交 50%

Steady-State Approximation Error of Heterogeneous Mean-Field Models

异质平均场模型的稳态近似误差

Lei Ying

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究异质平均场模型中M个智能体系统的占据测度与退火平均场平衡之间的稳态均方误差,建立了O(1/M)的界,揭示了异质系统需要初始条件扰动的均匀鲁棒性。

Comments Corrected a few minor typos and added a link to ref [6]

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 55 篇

2606.15579 2026-06-16 cs.AI cs.LG cs.MA cs.SE 新提交 90%

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

你的智能体有基因组:基于序列的LLM驱动自主智能体行为分析与运行时治理

Sidi Deng

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出XEPV序列编码框架,将LLM智能体行为建模为基因组序列,通过n-gram挖掘发现P-X-P高风险模式,设计Governor三层干预系统,使成功率提升6.2%并减少44% token消耗。

Comments 16 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14769 2026-06-16 econ.EM cs.AI cs.GT 新提交 87%

Agentomics: Economic Foundations for the Valuation, Attribution, and Pricing of AI Agents in Human-AI Workflows

Agentomics:人机协作工作流中AI代理的估值、归因和定价的经济基础

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(纽约大学Tandon工程学院电气与计算机工程系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 提出Agentomics框架,基于工作流模型将AI部署视为联盟形成问题,使用Shapley值进行经济盈余归因,实现AI代理的估值、归因和定价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15899 2026-06-16 cs.CR cs.AI cs.HC cs.LG cs.MA 新提交 86%

SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills

SkillVetBench: 基于LLM评判的多维安全风险评估开源LLM智能体技能

Ismail Hossain, Sai Puppala, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

机构 * SUPREME Lab, University of Texas at El Paso, Texas, USA(SUPREME实验室,德克萨斯理工大学埃尔帕索分校,德克萨斯州,美国)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 提出SkillVetBench,利用LLM作为评判器对开源LLM智能体技能进行多维安全风险评估,引入五维技能智能体风险评分(SARS)和CVSS v4.0向量分解,在78个恶意技能上实现零假阴性,22个良性技能上零假阳性。

Comments The main research paper is submitted to NeurIPS 2027, it is in under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16871 2026-06-16 cs.MA 新提交 85%

Human-on-the-Bridge: Scalable Evaluation for AI Agents

Human-on-the-Bridge: 可扩展的AI智能体评估方法

Fouad Bousetouane

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract)

AI总结 提出Human-on-the-Bridge (HOB)范式,通过专家预先策划可复用的评估智能体(包括领域上下文、红队陷阱、陪审员角色等),结合ProofAgent测试框架进行多轮对抗评估,实现可扩展的AI智能体行为评估。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06445 2026-06-16 cs.CL cs.AI cs.CR 版本更新 84%

A Survey on Agentic Security: Applications, Threats and Defenses

关于智能体安全的综述:应用、威胁与防御

Asif Shahriar, Md Nafiu Rahman, Sadif Ahmed, Farig Sadeque, Md Rizwan Parvez

机构 * BRAC University(布拉克大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文首次全面综述智能体安全领域,围绕应用、威胁与防御三大支柱,分类260余篇论文,分析攻击入口、防御策略及生命周期覆盖,指出智能体系统默认结构脆弱,需全生命周期防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15320 2026-06-16 cs.CV 新提交 83%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 Agent评测 :agent(summary_cn,abstract);agentic(abstract)

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏