Can Agent Memory Systems Track Evolving State?
智能体记忆系统能否追踪演化状态?
专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL
AI总结 该研究针对LLM智能体记忆系统的状态追踪能力不足问题,构建StateMemBench基准,提出StateMem方法,可显著提升当前状态准确率,且作为轻量包装器适配现有系统。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
智能体记忆系统能否追踪演化状态?
专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL
AI总结 该研究针对LLM智能体记忆系统的状态追踪能力不足问题,构建StateMemBench基准,提出StateMem方法,可显著提升当前状态准确率,且作为轻量包装器适配现有系统。
软件形态的第三次重构:从三层架构到存储、模型与智能体
机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出软件形态正经历第三次范式转变Software 3.0,其核心为存储、大模型与智能体的架构,将重塑开发者、数据库行业及软件工程的角色。
世界模型与现实对齐的不可约量子优势
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究证明经典世界模型无法通过增加记忆实现与真实世界的完美策略对齐,而量子世界模型仅用单个qutrit即可做到,揭示了世界模型对齐现实的不可约量子优势。
Comments 31 pages, 4 figures
语言具有两个参数:叙事诱导的语义可塑性与相位敏感的解读
机构 * University of Utah(犹他大学)
专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.CL
AI总结 该研究提出语言解读需第二个带符号、持久且以个体与二元组为索引的相位参数,指出标准Transformer无相位显式表征,需构建承载相位语义状态的语言模型。
Comments 23 pages; 0 figuresCC
从预测到自我:最小神经系统中能动性的发展条件
机构 * Independent Researcher(独立研究者)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 通过40个逐步增加的实验,研究最小GRU系统如何区分自我与世界因果影响,发现四个严格顺序的发展条件,并提出能动性增益作为度量指标。
Comments 27 pages, 6 figures
基于堆叠集成框架的异构内存IP中MBIST面积与测试时间的自动化估算
专题命中 记忆与上下文管理 :planning(abstract)
AI总结 本研究提出堆叠集成框架,基于RTL参数直接预测异构内存IP的MBIST面积与测试时间,准确率优于基线方法,可快速估算MBIST开销以支持高效设计决策。
评估上下文协议(ECP):一种用于AI智能体评估的便携式契约
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);autonomous agent(abstract);agentic(abstract)
AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。
Comments 14 pages, 4 tables, 4 figures, Code available at https://github.com/evaluation-context-protocol
编码智能体作为世界模拟器
机构 * Department of Mechanical & Aerospace Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校机械与航空航天工程系) ; School of Computer, Data, and Information Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机、数据与信息科学学院)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 提出一个通过可执行模拟代码构建基于物理的世界模型的智能体框架,协调规划、代码生成、视觉审查和物理分析智能体,迭代修正代码以满足物理约束,在物理准确性、指令忠实度和视觉质量上超越视频模型。
主动推理作为AI智能体的上下文获取机制
机构 * University of California, Davis(加利福尼亚大学戴维斯分校) ; Technical University of Munich(慕尼黑工业大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究将AI智能体的上下文获取权衡形式化为主动推理,在最优提问框架中验证其有效性,为智能体上下文获取层提供模型无关的设计原则。
AI智能体为何违反规则?框架、情境与社会信号如何影响合规性
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI、cs.CL
AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。
Comments Published at 2026 AAAI/ACM Conference on AI, Ethics, and Society and 2026 COLM Workshop on Agent Behavior
科学数据技能:实现规模化的智能体就绪型科学数据服务
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of the Chinese Academy of Sciences(中国科学院大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI
AI总结 针对现有数据集表示难以满足AI智能体需求的问题,提出SciDSK智能体就绪型表示并构建相关平台,可提升智能体的数据集发现与解释能力。
用于保障案例生成的智能检索增强生成与评估框架:欧盟网络弹性法案合规性的工业用例
专题命中 Agent评测 :agentic(title,abstract);分类 cs.SE
AI总结 该研究提出基于智能RAG的保障案例生成与评估框架,通过案例研究验证其可自动化欧盟网络弹性法案合规评定,减少人工并提升证据可追溯性。
Comments 6 pages, accepted at ISSRE 2026 (Industry track)
ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断
机构 * Shanghai AI Lab(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; KAUST(卡塔尔人工智能科学中心) ; East China Normal University(华东师范大学)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。
MaliciousSkillBench:用于恶意智能体技能检测的综合基准
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出MaliciousSkillBench这一综合基准,整合多源恶意技能数据构建含9740个技能的数据集,评估三类检测器后发现现有方法不足,需更广泛跨源覆盖及联合评估攻击检测与良性误报的方案。
Comments Project page: https://protectskills.github.io/MaliciousSkillBench/
Andy:用于严谨证明与自主研究的数学智能体
机构 * School of Mathematical Sciences, Tongji University(同济大学数学科学学院) ; Key Laboratory of Intelligent Computing and Applications (Tongji University)(同济大学智能计算与应用重点实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 该研究提出自主数学智能体Andy,以自触发脉冲共识的已发表结果为基础,构建混合控制方案并验证同步条件,展现其提出问题、开发并验证严谨证明的能力。
Comments 20 pages, 4 figures, 3 tables, and 3 algorithms. Research logs, reports, and simulation code are available at https://github.com/mowaiwaim/Andy
SkillResolve-Bench:衡量和解决智能体技能检索中的同能力歧义
机构 * Huawei Technologies Ltd(华为技术有限公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对智能体技能库中同一能力族内不同技能的执行风险,提出SkillResolve-Bench基准和SkillResolve方法,通过候选族解析和代表性选择,在保持高召回率的同时将有害技能暴露率降至0。
Comments Preprint. 21 pages, 3 figures, 6 tables. Supersedes arXiv:2606.10388
委托还是自行操作?理解混合人机界面中的用户行为
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究通过被试间实验对比三种交互模式,发现混合人机界面可降低交互成本,委托行为更多反映用户个体特征而非任务需求。
Comments 9 pages, In Proceedings of the 14th International Conference on Human-Agent Interaction at Osaka, Japan on November 16-19, 2026
面向规划的端到端自动驾驶:架构、评估与新兴范式
机构 * University of Macau(澳门大学) ; Chongqing University(重庆大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tongji University(同济大学) ; Beihang University(北京航空航天大学)
专题命中 Agent评测 :planning(title,abstract)
AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。
基本B效应:基于大语言模型(LLM)的智能体的使用会降低人们选择的独特性与多样性
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究通过实地研究和对照实验发现,使用基于LLM的智能体会降低人们选择的独特性与多样性,且顺序选择、智能体个性化会放大该效应,相关发现对设计维护人类多样性的AI系统具有重要意义。
ReguSim:评估大语言模型智能体在金融合规中的规则落地
机构 * HKUST(香港科技大学) ; HKBU(香港浸会大学) ; NTU(新加坡南洋理工大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。
DeltaML-Bench:基于真实研究仓库评估机器学习智能体
机构 * Algorithmic Research Group(算法研究组)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究推出DeltaML-Bench基准,评估发现基于搜索的ARG框架可提升GPT-5在机器学习实验任务中的成功率,且能避免规范博弈,为自主ML智能体部署提供了关键考量
Comments 18 pages, 3 figures, 12 tables. Code and benchmark: https://github.com/AlgorithmicResearchGroup/deltaml-bench-public
超越回忆:行为规范作为AI个性化的解释层
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。
Comments 142 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: github.com/agulaya24/beyond-recall 8/19 Replacement: Pages updated to 142 from 134. Added Table of Contents. Updated table/graph formatting. Updated Section 8: Data, Code, and Reproducibility to include updated links, corrected author names
工程推理与指令(ERI)基准:一个大规模的基于分类体系的数据集用于基础模型和代理
专题命中 Agent评测 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 ERI基准通过大规模分类数据集评估工程能力,揭示LLM在不同难度问题上的性能差异,并采用收敛验证协议降低幻觉风险。
语言模型中的无意上下文泄漏
机构 * FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Google DeepMind(谷歌DeepMind)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG
AI总结 该研究发现语言模型的上下文窗口会无意泄漏敏感用户信息,提出自适应攻击方法,在8个专有模型上验证了2、4位数秘密的重建准确率,还展示了两种实际攻击方式,指出泄漏是模型能力的副产品。
单次成功并非可靠:Thinkingbox——面向有状态业务工作流智能体的沙箱与基准测试集
机构 * University of Pittsburgh(匹兹堡大学) ; Northwestern University(西北大学) ; University of California Irvine(加州大学欧文分校) ; Microsoft(微软公司)
专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.CL
AI总结 研究人员推出面向有状态业务工作流智能体的沙箱Thinkingbox及基准测试集Thinkingbox-bench,发现现有智能体在该基准上可靠完成任务的表现远逊于单次成功表现,凸显了端到端任务可靠评估的必要性。
专题讨论会:面向AI科学家智能体社群的可审计记录信任机制
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 Symposium是面向AI科学家智能体社群的可审计记录信任框架,通过保留科研活动的不可变历史与科学论证,支持信任评估,且提供可快速部署的实现。
AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。
Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化
机构 * The University of Tokyo(东京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 Task-CoEvolve通过自适应验证任务选择,使LLM智能体框架与验证任务协同演化,在保持全集搜索最终性能的同时,减少80%评估次数,实现高效的智能体框架优化。
Comments Github: https://github.com/Agent4Science-UTokyo/Task-CoEvolve
随机突变作为新冠病毒新变体出现的机制——关于人工智能范式的科学猜想
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 本文总结新冠疫情传播动力学研究,提出科学猜想是科研的重要驱动力,还提出问答式AI相比AI智能体更高效低成本的AI范式猜想。
Comments 22 pages, 4 figures
从准确性到可审计性:金融AI系统中的确定性综述
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。