arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-25 至 2026-08-25 共收录 381 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 29 篇

2110.06890 2026-08-25 cs.AI cs.LG 62%

Extending Environments To Measure Self-Reflection In Reinforcement Learning

Samuel Allen Alexander, Michael Castaneda, Kevin Compher, Oscar Martinez

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 2 figures, 1 table, 2 listings

Journal ref Journal of Artificial General Intelligence, volume 13, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21690 2026-08-25 cs.AI 新提交 57%

Context as an Environment: Programmatic Context Management for Long-Horizon Agents

上下文作为环境:面向长程智能体的程序化上下文管理

Yin Lin, Elaine Ang, Erkang Zhu, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团) Columbia University(哥伦比亚大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本研究提出名为Scroll的上下文管理器,将智能体会话视为可执行环境,结合事件日志与Python内核实现程序化上下文管理,在多个长程智能体基准测试中大幅超越现有最优系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14393 2026-08-25 cs.RO cs.AI 版本更新 57%

An offline approach to fNIRS-guided reinforcement learning for robot behavior

一种用于机器人行为的基于fNIRS引导的强化学习的离线方法

Julia Santaniello, Madelaine Brower, Benson Jiang, Donatello Sassaroli, Chenyuan Zhang, Robert Jacob, Jivko Sinapov

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究利用fNIRS脑信号调节机器人模拟学习的可行性,比较不同交互任务训练的智能体,测试多种增强强化学习算法的方法,发现该框架能有效利用神经信号增强学习,还可离线学习,为特定场景提供替代方案。

Comments Preliminary results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21814 2026-08-25 q-bio.NC 新提交 50%

Forward and reverse delay-driven hippocampal replay without symmetric plasticity

无对称可塑性的前向与反向延迟驱动海马重放

Georg Reich, Matthew Cook, Klaus Obermayer, Pau Vilimelis Aceituno

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 提出延迟耦合的CA3神经场模型,证明无论对称或不对称可塑性均可实现双向海马重放,推导动力学低维描述并分析重放速度稳定性,为双向重放的机制提供新解释。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23405 2026-08-25 cs.CV cs.RO 新提交 50%

MomADv2: Reliable Temporal Memory for End-to-End Autonomous Driving

MomADv2:面向端到端自动驾驶的可靠时序记忆

Ziying Song, Shengkai Zhang, Lin Liu, Peiliang Wu, Lei Yang, Dongyang Xu, Bin Sun, Li Wang, Shaoqing Xu, Caiyan Jia, Yadan Luo

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 针对自动驾驶时序记忆易失效的问题,提出 MomADv2 框架,含选择性记忆查询模块与流匹配残差修正器,在多数据集上使碰撞率降 15.6%。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23050 2026-08-25 cs.HC 新提交 50%

What Makes an Initial Reaction Ready for Discussion?: Multi-Persona AI Support for Stance Reflection and Writing

是什么让初始反应适合讨论?:用于立场反思与写作的多角色AI支持

Sky Shih-Kai Hong, Mu-Tien Kuo, Wei-Ji Chen

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本研究提出多角色AI工具StanceLab,通过对比三角色模式与独立LLM模式的试点,明确了设计需求并规划了未来工作流,助力用户准备讨论立场。

Comments 5 pages, 3 figures, 2 tables. Accepted to TAICHI 2026 (https://taichi2026.taiwanchi.org/program)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22702 2026-08-25 cs.HC 新提交 50%

AffAdapt: AFFect-driven ADAPTive AI Personas for Seamless Conversations

AffAdapt:面向流畅对话的情感驱动型自适应AI角色

Nishanth Chidambaram, Kaustubh Paliwal, Kayla Hom, Shaoze Zhou, Chen Chen, Manas Satish Bedmutha, Nadir Weibel

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究提出AffAdapt框架,整合多模块构建AI角色交互循环,实现流畅人机对话,在高风险对话场景验证其有效性,指出相关挑战并说明其应用场景。

Comments 3 pages, 2 figures, Adjunct Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26 Adjunct), Detroit, MI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22640 2026-08-25 math.AP 新提交 50%

Kinetics of an Expanding Bacterial Colony: Continuum Modeling and Analysis

扩张细菌菌落的动力学:连续介质建模与分析

Bo Li, Mykhailo Potomkin

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本研究针对硬质基质上扩张的细菌菌落,构建含反应-扩散方程、拉普拉斯方程的移动边界连续介质模型,分析其垂直与径向扩张特性,结果与实验及智能体模拟相符。

Comments 56 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 69 篇

2608.23552 2026-08-25 cs.AI cs.CL cs.SE 新提交 91%

Prime Agent: A Self-Improving RLM Harness

Prime Agent:一种自改进的RLM管控框架

Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch, Daniel Auras, Mika Senghaas, Fares Obeid, Konstantin Dunas, Johannes Hagemann, Sami Jaghouar

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Prime Intellect

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 Prime Agent是一款开源RLM管控框架,通过标准化流程提升模型长周期能力,在ARC-AGI-3等任务中大幅提升性能,支持编码等工作流与并行化任务。

Comments 16 pages, 10 figures. Technical report. Code: https://github.com/PrimeIntellect-ai/prime-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15389 2026-08-25 cs.AI 版本更新 89%

Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL

重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析

Yiyun Su, Zujun Peng, Yu Tian, Yuting Liu, Changruo Zhao, Huiying Zhu, Luyan Zhang, Heming Zeng

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract_cn);分类 cs.AI

AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11596 2026-08-25 eess.SP cs.AI cs.SY eess.SY 交叉投稿 88%

Small Language Model enabled Autonomous agent for Language-Conditioned Cognitive Radar

基于小型语言模型的语言条件认知雷达自主智能体

Minhaj Uddin Ahmad, Zakia Zaman, Shunqiao Sun, Mizanur Rahman

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 本文提出一种小型语言模型驱动的自主智能体框架,作为语言条件认知雷达的智能控制器,经实验验证可在多种雷达场景下完成算法选择,且雷达特定提示与基于物理的工具执行是可靠决策的必要条件。

Comments Accepted at MLSP 2026, ATL, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21381 2026-08-25 cs.CY cs.CL 新提交 85%

PersonaMem-v3: Toward Omni-Platform Personal Intelligence for Holistic User Understanding, Recommendation, and Agentic Tasks

PersonaMem-v3:面向全平台个人智能以实现全面的用户理解、推荐及智能体任务

Bowen Jiang, Yuan Yuan, Zhuoqun Hao, Yuchen Liu, Maohao Shen, Sihao Chen, Gregory Wornell, Chris Callison-Burch, Lyle Ungar, Dan Roth, Qi Guo, Xiangjun Fan, Camillo J. Taylor, Hanchao Yu

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);tool use(abstract);分类 cs.CL

AI总结 该研究提出PersonaMem-v3基准,用于评估全平台个人智能,助力开发兼具跨场景用户理解、可控推荐及合理个性化能力的LLM驱动智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-25 cs.CR cs.AI 版本更新 85%

Your Agentic LLMs Secretly Encode Indirect Prompt-Injection Exposure in Hidden States

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Peng Xu, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments v2. Compared to v1, we include the Kimi-K3 model's results and conduct a series of new experiments on understanding probe generalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09855 2026-08-25 cs.AI cs.CL 版本更新 84%

The Greatness of Science Cannot Be Planned: Agentic Auto-Research is Fuzz Testing

智能体自动研究即模糊测试

Yifeng He, Jicheng Wang, Yinzhe Zhao, Chengyang Shi, Jiachen Liu, Hao Chen

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出自主研究智能体的“生成-排序”范式存在反馈稀疏性问题,类比灰盒模糊测试,指出自动研究需具备密集进展信号与反馈导向搜索能力,强调反馈架构是自动研究的核心瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23501 2026-08-25 cs.SE 新提交 83%

An Interactive Agent for Requirement-Driven Candidate Sourcing

面向需求驱动型候选人挖掘的交互式智能体

Yuanpeng He, Fangjing Li, Xiangyu Ru, Kexin Sun, Kun Yang, Lijian Li, Chi-Man Pun, Qingsong Wen, Wenpin Jiao, Mingkai Guo, Yirong Feng, Daiheng Gao, Zhi Jin

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 该研究针对自然语言描述的人才挖掘任务,提出首个交互式需求驱动型候选人挖掘智能体,在21个系统和691项需求上,其广度和召回率均优于现有基线模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23341 2026-08-25 cs.SE 新提交 83%

DPIAgent: Divide, Protocol, Isolate for Agentic Reproduction Test Generation

DPIAgent:面向智能体复现测试用例生成的Divide、Protocol、Isolate方法

Hao Liu, Steven Liu, Xin Zhang, Jane Luo, Yu Kang, Jie Wu, Fangkai Yang, Yangyu Huang, Pengfei Gao, Scarlett Li, Yan Lu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 DPIAgent是基于Divide、Protocol、Isolate原则的结构化智能体框架,将复现测试用例生成拆分为单目标阶段,在SWT-Bench Verified上优于七个基线方法,GPT-5成功率达81.76%,添加测试选择后升至86.17%,通用性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21444 2026-08-25 cs.AI cs.ET cs.HC cs.RO 新提交 83%

Agentic AI for Safety-critical Multi-drone Systems: Challenges and Opportunities

面向安全关键多无人机系统的智能体人工智能:挑战与机遇

Timothy Merritt, Alejandro Jarabo-Peñas, Juan Bravo-Arrabal, Maria-Theresa Bahodi, Anders Lyhne Christensen

机构 * Aalborg University(奥尔堡大学) University of Southern Denmark(南丹麦大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文针对安全关键多无人机系统应用受限问题,结合NAMUR、PERSIST项目经验,提出将智能体AI作为社会技术设计问题,采用以人为本的迭代方法开发可迁移的概念验证系统与评估策略。

Comments 9 pages, 4 figures, presented at the AgentCraft Workshop at IUI2026 Conference, https://agentcraft-iui.github.io/2026/ - CEUR-WS.org proceedings forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21375 2026-08-25 cs.AI 新提交 83%

SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG

SchemaRouter:面向高效异构智能体检索增强生成的字段感知工具路由

Yong-eun Cho

机构 * KailosLab(凯洛斯实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 SchemaRouter是轻量级字段感知工具路由层,通过模式图实现工具与字段的精准选择,在材料科学基准中,其效率、准确率、工具精确率等表现优于基线,还能提供来源与许可信息。

Comments 13 pages, 4 figures, 6 tables. Code, benchmark, and fixtures: https://github.com/JDeun/SchemaRouter_research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22930 2026-08-25 cs.AI cs.SE 新提交 82%

Concepts for Securing Agentic AI Coding and the Terok Environment

智能体AI编码的安全概念与Terok环境

Jiří Vyskočil, Franz Pöschel, Andreas Knüpfer

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心(CASUS)) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心(HZDR))

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE;agent(comments);multi-agent(comments)

AI总结 本文针对智能体AI编码的IT安全风险,提出风险评估、无损失缓解概念及实现概述,助力社区安全评估该技术的应用潜力。

Comments to be published in the proceedings of the AGENSYS workshop (Workshop on Knowledge Discovery, Maintenance and Distributed Intelligence in Multi-Agent Systems) at ECML PKDD 2026 conference in Sept. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21470 2026-08-25 cs.CR 新提交 82%

Structural Inference in Undocumented Mobile Databases: A Reproducible Benchmark for Evaluating Agentic Reasoning in Digital Forensics

无文档移动数据库中的结构推断:用于评估数字取证中智能体推理能力的可复现基准

Jeel Piyushkumar Khatiwala, Divyangkumar Patel, Weifeng Xu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本研究构建了可复现基准,评估智能体对无文档移动数据库的结构推断能力,发现其在规则模式下可靠,模式模糊时性能骤降,需额外验证以确保推断关系可作为可靠取证证据。

Comments 10 pages, 2 figures. Published in Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, July 2026

Journal ref Proc. 50th IEEE Annual Computers, Software, and Applications Conference (COMPSAC), Madrid, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-25 cs.AI 新提交 81%

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21829 2026-08-25 cs.CL cs.AI cs.IR 新提交 81%

Training a Knowledge Base: Supervised Structure Learning for Agent-Curated Document Stores

训练知识库:智能体策划文档存储的监督结构学习

Yu Pan, Hongfeng Yu

机构 * University of Nebraska–Lincoln(内布拉斯加大学林肯分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究提出监督式结构学习方法训练知识库,以智能体策划文档存储,提升动作效率与准确率,其泛化性与键覆盖相关,欠训练的存储可通过增加训练问题进一步优化。

Comments 10 pages, 4 figures, 5 tables. Submitted to IEEE BigData 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21601 2026-08-25 cs.AI cs.CL 新提交 81%

K-Bench: measuring model performance on real scientific agent requests

K-Bench:衡量模型在真实科学智能体请求上的性能

Aubrey Brueckner, Darshil Patel, Yuhuan He, Timothy Kassis

机构 * K-Dense, Inc.(K-Dense公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究构建K-Bench 01基准,评估9个前沿模型处理真实科学请求的性能,发现无模型达领域科学家接受阈值,科学准确性难度高于沟通能力,核心应关注交付、宣称与产物的联合分布。

Comments 48 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21916 2026-08-25 cs.CE 新提交 80%

GenomeHarness: Harnessing Al Agents for Reliable Adaptation of Genome Language Models

GenomeHarness:利用AI智能体实现基因组语言模型的可靠适配

Weicai Long, Yusen Hou, Houcheng Su, Junning Feng, Yanlin Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 GenomeHarness是一种智能体式工具,通过受控搜索微调方案适配基因组语言模型,在52个模型-任务设置中多数提升了测试MCC,使下游适配更可靠可审计。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22133 2026-08-25 math.DG 新提交 80%

A Metric with Positive Sectional Curvature on $S^2\times S^3$

S²×S³上具有正截面曲率的度量

Shengtao Guo, Ethan X. Fang, Junwei Lu

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 Odin Automatic AI Research Agent构造S²×S²上第一陈类(1,1)的主S¹-丛,经Cheeger形变等步骤,得到S²×S³上的正截面曲率黎曼度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23417 2026-08-25 cs.AI 新提交 79%

SkillAlchemy: Open-World Agent Skill Creation

SkillAlchemy:开放世界智能体技能创建

Hengjun Wang, Shuyue Wei, Boyi Liu, Jun Yang, Yongxin Tong

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 SkillAlchemy是一个以准入为中心的基于源的开放世界智能体技能创建框架,在87个SkillsBench v1.1任务上,其技能通过率较无技能执行提升19.9个百分点、较最强自动化基线提升8.6个百分点,性能接近人工策划技能。

Comments 33 pages, 7 figures, 8 tables. Includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23067 2026-08-25 cs.CL 新提交 79%

Signal or Noise? A Benchmark Study of Agent Skills in Web Development

信号还是噪声?智能体在Web开发中的技能基准研究

Ziyue Yang, Fan Ding

机构 * Baidu(百度)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 该研究构建WebDev-Skills-Bench基准,通过实证分析Web开发智能体技能的效果,发现技能注入会降低任务性能、增加成本,提出需将技能视为特定三元组假设并建立对应评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22808 2026-08-25 cs.LG cs.MA cs.PF 新提交 79%

CatchBench: When Can an Agent Failure Be Caught?

CatchBench:智能体故障何时能被检测?

Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 CatchBench是首个在同一任务-方法接口下对智能体运行前、运行中、完成后三种信息状态进行评分的基准,涵盖多类模型与配置,揭示基准分数需结合标签过程才可解释。

Comments 39 pages, 6 figures, 21 tables. Work in progress. Code and data: https://github.com/yzhao062/catchbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22510 2026-08-25 cs.AI 新提交 79%

ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts

ClawProBench:基于运行时覆盖与冻结工作空间保留集的轨迹感知AI智能体评估

YuanHang Xiao

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 该研究提出ClawProBench基准,基于OpenClaw运行时构建,通过含102场景的全配置集与68场景的冻结保留集评估AI智能体,采用安全门控公式评分,发现最终答案排行榜存在缺陷,不同评估视角的智能体排名差异显著。

Comments 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22444 2026-08-25 cs.CL 新提交 79%

Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations

单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获

Isotta Magistrali, Chen Shani

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏