arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-27 至 2026-08-27 共收录 205 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 18 篇

2608.25570 2026-08-27 cs.LG cs.MA 新提交 79%

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization via an Experience-Driven Workflow and Experience Graph Memory

超越缩放:基于经验驱动工作流与经验图记忆的硬件内核优化自演进大语言模型智能体

Siyuan Chen, Runlin Hou, Shenxiu Wu, Yansong Sun, Junming Cao, Yiyu Zhang, Shudi Shao, Junhao Qiu, Zhichao Lu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 记忆与上下文管理 :workflow(title);agent(abstract);分类 cs.LG

AI总结 本文提出KOPE框架,通过经验图记忆与主动上下文管理实现硬件内核优化自演进LLM智能体,在相同模型设置下其加速比、通过率等关键指标显著优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22149 2026-08-27 cs.RO cs.AI 版本更新 70%

Meta-Ctrl: Guaranteed Plan Generation by Decoupling Syntactic and Semantic Constraints

Meta-Ctrl:通过分离句法与语义约束实现带保证的规划生成

Gwen Yidou-Weng, Edward Sun, Tianyi Ma, Metin Alp Dogan, Benjie Wang, Allen Peng, Guy Van den Broeck, Yuchen Cui

机构 * Michigan State University(密歇根州立大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 记忆与上下文管理 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 Meta-Ctrl是一种约束解码框架,通过引入元标记分离句法与语义约束,在保证规划满足约束的同时保留语言模型的规划质量,在WAH-NL数据集和真实桌面机器人上均取得优于GPT-4的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21156 2026-08-27 cs.IR cs.AI cs.ET 版本更新 70%

Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence

大语言模型智能体时代的图工程:从个体智能到系统智能

Yuyuan Feng, Zhishang Xiang, Chaobin Yang, Qichao Ma, Zerui Chen, Yujing Zhang, Ke Huang, Chuanjie Wu, Zhaoxu Liu, Yili Wang, Xin He, Jiapu Wang, Zijin Hong, Hao Chen, Yuanchen Bei, Kun Wang, Shengyuan Chen, Ningyu Zhang, Enyan Dai, Linhao Luo, Qingyi Pan, Qi Wang, Wenqi Fan, Guangjing Wang, Na Zou, Yangqiu Song, Xin Wang, Zechao Li, Xia Hu, Qing Li, Xiao Huang, Zhihong Zhang, Jinsong Su, Qinggang Zhang, Yi Chang

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体复杂任务的个体智能局限,提出图工程范式,通过构建动态图结构组织协调异构智能体,为系统智能提供统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16899 2026-08-27 cs.LG cs.AI 版本更新 62%

Epistemic Memory: A Validity Layer for Self-Maintaining Intelligent Systems

认知记忆:自维持智能系统的有效性层

Pin-Han Ho, Limei Peng, Yiming Miao, Yan Jiao

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对AI记忆机制忽略知识有效性条件导致语义坐标漂移的问题,提出认知记忆作为有效性维护层,引入OBM架构,实验表明其可提升智能体在变化观测条件下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25618 2026-08-27 cs.CL 新提交 57%

AWM: Answerable Working Memory for Long-Document VQA Agents

AWM:面向长文档VLM智能体的可回答工作记忆

Dongzhuoran Zhou, Yuqicheng Zhu, Yule Liu, Zhen Yang, Rui Lu, Yuxiao Dong, Jie Tang, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 针对长文档VQA智能体的记忆质量盲区,提出AWM方法,通过融入仅记忆可回答性的GRPO奖励机制,提升了最终答案准确率并降低记忆缺失正确的比例。

Comments EMNLP 2026 Findings. 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25577 2026-08-27 cs.DB cs.AI 新提交 57%

PolyMemDB: A Polyglot Database System for AI Memory Management

PolyMemDB:一款面向AI记忆管理的多语言数据库系统

Yu Wang, Jiaheng Lu

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 针对现有智能体记忆系统的存储碎片化与事实冲突问题,推出PolyMemDB多语言数据库系统,通过多语言存储架构与概率推理引擎管理智能体记忆,以减少LLM幻觉并提升个性化体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12476 2026-08-27 cs.AI 版本更新 57%

Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents

受控持久内存:长程智能体的源绑定状态语义与故障关闭式释放

Guodong Xu

机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛果动先生网络科技有限公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文针对长程智能体内存的矛盾记录问题,提出受控持久内存(GPM)模型,经多组基准测试与服务评估,其在GPM-ReleaseBench、中英文指令分支等场景均实现零不匹配,修复大量基线故障且无退化。

Comments 23 pages, 2 figures, 11 tables. Includes a sealed end-to-end governed-memory service evaluation with an ungoverned local Qwen2.5-7B comparison

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02689 2026-08-27 cs.CV cs.AI 版本更新 57%

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

S-EMBER:用于流式自我中心记忆检索的大规模基准测试

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Ghosh, Xin Dong, Wen-Tau Yih

机构 * FAIR, Meta(公平研究院,元公司) Reality Labs, Meta(现实实验室,元公司)

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI

AI总结 研究针对可穿戴设备连续第一人称记录下AI助手的情景记忆问题,引入S-EMBER基准测试,通过视频及问答对模拟真实交互,发现前沿模型存在定位矛盾,为可穿戴AI代理情景记忆发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26075 2026-08-27 cs.SI 新提交 50%

Epistemic Networks, Collective Misperception, and the Manipulation of Social Knowledge

认知网络、集体误解与社会知识的操纵

Mihnea C. Moldoveanu, Joel A. C. Baum

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 该研究聚焦网络中智能体的交互信念结构,提出以相互归因张量为社会认知分析单元,揭示集体误解等现象的构成及高阶信念与认知网络游走的关联。

Comments 56 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07035 2026-08-27 cs.IR 版本更新 50%

MISO: Model-Internal-State-Guided Optimization for Ranking Models

MISO:面向排序模型的模型内部状态引导优化

Yongzhe Zhang, Xiaoyu Deng, Yifan He, Mengying Sun, Sheng Luo, Yijia Liu, Hao Yan, Zhuo Li, Huiping Yao, Swathi Hrishikesh, Jing Chen, Dennis Choi, Steven Liu, Zhiwen Chen, Yang Jin, Haoyu Zhou, Lexi Luo, Keyi Chen, Anish Khazane, Marcio Porto, Xiaoya Wang, Emmy Wang, Jiang Liu, Kangfu Zheng, Xingyuan Wang, Peggy Yao, Yi Meng, Bilal Fadlallah, Gursharan Singh, Prabhakar Goyal, Alireza Vahdatpour, Santanu Kolay

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 针对排序模型优化依赖昂贵试错的问题,提出利用模型内部状态的MISO工作流,在广告排序案例中提升归一化熵且减少验证运行,实现手动调优与自动搜索的折中。

Comments Accepted at the OARS Workshop at ACM RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26327 2026-08-27 econ.TH 版本更新 50%

The Last Costly Signal: How Generative AI Collapses Competence Signaling and Why Liability Sustains Markets for Expert Services

最后一个高成本信号:生成式AI如何瓦解能力信号机制,以及为何责任机制能维持专家服务市场

Andreas Bauer

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究生成式AI降低专家服务信号成本导致的市场混同问题,提出结果依赖型责任信号可恢复市场分离,还内生化合同制度并设计了相关验证实验。

Comments 39 pages, 7 figures. JEL codes: D82, D86, L15, L84, M31, O33. Simulation code and numerical results available at: https://doi.org/10.6084/m9.figshare.33106946

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10381 2026-08-27 cond-mat.stat-mech nlin.AO 版本更新 50%

Revisiting the non-equilibrium phase transitions of the continuous-trait Axelrod model

重新审视连续性状阿克塞尔罗德模型的非平衡相变

Sandro M. Reia, Paulo R. A. Campos, José F. Fontanari

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究连续性状阿克塞尔罗德模型的非平衡相变,通过分析中位数缩放和概率分布揭示其相变特征,发现\(F = 2\)时为混合转变,\(F = 3\)时为非混合一阶转变,还应用于离散泊松变体建立统一表征。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 41 篇

2608.26004 2026-08-27 cs.AI cs.CL 新提交 88%

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

AsymSpec:面向智能体大语言模型的上下文非对称投机解码

Sheng Liang, Yongyue Zhang, Nathanael Brian, Hang Lv, Hao Wang, Chen Zhang, Yong Liu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 AsymSpec是面向智能体大语言模型的非对称投机解码框架,通过轻量级草稿读全输入、大型验证模型用压缩视图,实现近90%完整上下文准确率,获1.3-1.7倍吞吐量加速且计算成本仅0.2-0.3倍。

Comments EMNLP Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24076 2026-08-27 cs.AI 版本更新 85%

AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval

AgentWorld:面向智能体信息检索的人格感知可靠性评估

Gunja Agarwal, Arup Kumar Das, Arun Menon, Jitesh Chandra Mishra, Vignesh Divakaran

机构 * PayPal(贝宝)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 AgentWorld框架整合多模块,通过三类实验验证其可评估智能体信息检索的人格感知可靠性,能发现统一测试未暴露的故障模式及轨迹级脆弱性。

Comments Accepted at Agent4IR @ KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25340 2026-08-27 cs.HC 新提交 85%

HRGuard: Gating Relationship Manipulation in Multi-Turn Agentic AI Conversations

HRGuard:多轮智能体AI对话中的门控关系操纵

Pei-Sze Tan, Tasuku Igarashi, Isao Echizen

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);workflow(abstract)

AI总结 针对多轮智能体AI对话中AI协助的人际操纵问题,构建含1000个五轮对话的基准数据集,提出HRGuard双门控机制,在8个模型上表现优于通用安全方案,可减少有害顺从并保留保护指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19380 2026-08-27 cs.SE cs.LG 版本更新 84%

ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

AgentArmor:编码代理失败的框架、评估与缓解

Kenneth Ge, Andre Assis

机构 * Anthropic Fellows Program(Anthropic Fellow 项目) Constellation

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.LG、cs.SE

AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。

Comments Accepted at The Third Annual Conference on Language Modeling 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-08-27 cs.IR cs.AI cs.CL cs.MA 版本更新 84%

Corpus2Skill: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25286 2026-08-27 cs.AI q-bio.QM 新提交 83%

BixBench3: Benchmarking AI agents on research-study-scale computational biology tasks

BixBench3:面向研究级计算生物学任务的AI智能体基准测试

Zane Koch, Asmamaw T. Wassie, Javier Valdes-Aleman, Jason Lee, Michaela M. Hinks, Samuel G. Rodriques, Andrew D. White, Jon M. Laurent

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究人员推出BixBench3基准测试,评估AI智能体完成研究级计算生物学任务的能力,发现前沿模型表现差异大,且智能体在大数据集、多步骤任务中性能更差,高分智能体更高效。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25067 2026-08-27 cs.AI 新提交 83%

SimVerity: When Does Simulated Agent Success Survive Physical Deployment?

SimVerity:当模拟智能体的成功能在物理部署中延续时?

Zhonghao Zhan, Yefan Zhang, Krinos Li, Hamed Haddadi

机构 * Imperial College London(帝国理工学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究量化模拟智能体成功与物理部署的关联,提出SimVerity框架,通过交叉验证判决转移,发现模拟通过与物理实际存在差异,可预测错误通过并提升智能体可审计性,暴露模拟器盲点。

Comments Submitted to the Main Technical Track of AAAI Conference on Artificial Intelligence (AAAI-27); currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08636 2026-08-27 cs.CL 版本更新 83%

InternBootcamp: Boosting LLM Reasoning with Verifiable Task Scaling

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Peiji Li, Jiasheng Ye, Yongkang Chen, Linyang Li, Yichuan Ma, Zijie Yu, Ganqu Cui, Haozhan Li, Jiacheng Chen, Chengqi Lyu, Wenwei Zhang, Qipeng Guo, Dahua Lin, Bowen Zhou, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04879 2026-08-27 cs.CL 版本更新 83%

Mind2Report: Expert-Level Commercial Report Synthesis via Cognitive Deep Research Agent

Mind2Report: 一种用于专家级商业报告综合的认知深度研究代理

Mingyue Cheng, Daoyu Wang, Qi Liu, Shuo Yu, Xiaoyu Tao, Yuqian Wang, Chengzhong Chu, Yu Duan, Mingkang Long, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Engineering Institute, iFLYTEK Co., Ltd(人工智能工程院,iFLYTEK公司)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.CL

AI总结 Mind2Report是一种通过动态内存增强大语言模型,实现专家级商业报告综合的认知深度研究代理,优于现有基线模型。

Comments Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026), Rome, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04424 2026-08-27 cs.CL 版本更新 83%

Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

Gavel: 智能体结合检查表评估LLM长上下文法律摘要

Yao Dou, Benjamin Mamut, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 提出Gavel框架,通过参考评估和免参考智能体评估12个前沿LLM在多文档法律摘要中的表现,发现模型易遗漏关键信息而非幻觉,且性能随案件长度增加而下降。

Comments Accepted at EMNLP 2026 Main; webpage at https://yao-dou.github.io/gavel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-08-27 cs.AI 版本更新 83%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 Agent评测 :agentic(title);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25124 2026-08-27 cs.CE 新提交 82%

FABRICA: Agentic CUDA-to-CSL Translation and Optimization for Wafer-Scale Systems

FABRICA:面向晶圆级系统的智能体CUDA到CSL的翻译与优化框架

Yuebo Luo, Eliu Huerta, Venkatram Vishwanath, Caiwen Ding, Rajeev Thakur, Le Chen

专题命中 Agent评测 :agentic(title,abstract);workflow(abstract)

AI总结 FABRICA是结合目标知识、故障修复与正确性优化的智能体框架,在晶圆级系统的CUDA转CSL内核任务中,大幅提升成功率并实现3.47×以上加速,凸显跨架构内核生成的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00894 2026-08-27 cs.AR 版本更新 82%

Rethinking Agentic Kernel Generation for Emerging Accelerators

面向新兴加速器的智能体内核生成方法反思

Ruijie Gao, Jirong Yang, Barry Lyu, Haoran Jin, Nathan Bleier

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 针对新兴加速器内核生成的现有方法反复重建无关语义的问题,提出编译器介导的Zomboss框架,将语义编译为可复用接口,在20个Gemmini和36个PLENA工作负载上实现全实例正确,且性能优于基线方法、推理成本更低。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-08-27 cs.CR cs.AI 版本更新 81%

APPA: Recoverable Information-Flow Control for Real-World LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments 21 pages, 3 figures. v2: Major revision with updated title, MCP protocol gateway architecture, 3-model empirical benchmark (6,600 episodes), recovery ablations, gradual security typing, and complete formal safety proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22133 2026-08-27 math.DG 版本更新 80%

A Metric with Positive Sectional Curvature on $S^2\times S^3$

S²×S³上具有正截面曲率的度量

Shengtao Guo, Ethan X. Fang, Junwei Lu

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 Odin Automatic AI Research Agent构造S²×S²上第一陈类(1,1)的主S¹-丛,经Cheeger形变等步骤,得到S²×S³上的正截面曲率黎曼度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17237 2026-08-27 cs.CV cs.AI 版本更新 79%

Training-Free Agentic Computer Vision for Structural Component Detection in 2D Structural Framing Plans

基于确定性几何与受约束智能体视觉-语言优化的结构平面图到模型转换

Mohammad Talebi-Kalaleh, Qipei Mei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 该研究提出首个无需特定任务检测器训练的结构平面图转模型框架,经100张图基准评估,各构件指标优异,可高效修正绘图错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14940 2026-08-27 cs.AI cs.CY 版本更新 79%

When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation

智能体评估何时结束?结果终局性与跨单元分离

Avyay M. Casheekar, Hariganesh Tangirala

机构 * University of Michigan Law School(密歇根大学法学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对现有智能体评估将终点分数视为最终结果的问题,该研究提出结果终局性与跨单元分离两个条件,通过实验和协议审查指出当前评估的不足,并提出开放效应记录方案以完善评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14571 2026-08-27 cs.AI 版本更新 79%

StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance

StreamMemBench: 面向未来辅助的智能体记忆流式评估

Guanming Liu, Yuqi Ren, Hansu Gu, Peng Zhang, Weihang Wang, Jiahao Liu, Ning Gu, Tun Lu

机构 * Fudan University(复旦大学) Amazon Stream(亚马逊流)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出StreamMemBench基准,通过两步任务序列测试智能体记忆从流式观察到后续任务中证据回忆、反馈整合与重用能力,实验发现现有系统在证据使用和反馈转化上存在不足。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏