arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-24 至 2026-08-24 共收录 190 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 18 篇

2608.20711 2026-08-24 cs.CL 新提交 83%

AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification

AsmEvo:采用功能等价性验证的AMD GPU内核智能体级汇编层优化工具

Ji Liu, Puyuan Yang, Rongzhang Zheng, Fan Wang, Jinglin Wang, Muhammad A. Awad, Mortis Huang, Andy Chang, Zekai Li, Zeping Li, Zihao An, Yue Liu, Yuchen Yang, Jianghui Wang, Chushi Chen, Ziqiong Liu, Fuwei Yang, Dong Li, Wen Heng Chung, Shengcai Liu, Emad Barsoum

机构 * AMD(超威半导体公司)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 AsmEvo是一款针对AMD GPU内核的智能体级汇编层优化工具,通过功能等价性验证优化已编译的AMDGPU代码对象,在多款AMD GPU上实现了显著加速比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20566 2026-08-24 cs.LG 新提交 83%

AgentDecarbonizer: Carbon-Aware Execution for AI Agents

AgentDecarbonizer:面向AI智能体的碳感知执行方案

Leyi Yan, Shuangning Li, Sihang Liu

机构 * University of Waterloo(滑铁卢大学) University of Chicago(芝加哥大学)

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文针对AI智能体工作流碳排放高的问题,提出AgentDecarbonizer碳优化器,可结合截止日期、电网碳强度等选择调度方案,在WildClawBench上最多降低57.9%碳排放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20749 2026-08-24 cs.CV 新提交 82%

Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

通过智能体增强与语义修复实现身份保留的文本到视频生成

Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 软件智能体 :agentic(title,abstract)

AI总结 针对现有商业视频生成模型的身份漂移等缺陷,提出AESR轻量级框架,含智能体提示增强与视觉语义修复模块,搭配混合专家选择策略,其系统MIPL_Video在ACM MM 2026挑战赛赛道1获第一

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20637 2026-08-24 cs.CR cs.AI 新提交 79%

ARQ: Agentic CodeQL Query Refinement for C/C++ Vulnerability Detection

ARQ:用于C/C++漏洞检测的智能CodeQL查询优化框架

Chunyi Wang, Yunfei Ke, Junfeng Yang, Yun-Yun Tsai, Penghui Li

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ARQ智能框架,利用合成C/C++程序的执行证据和LLM优化CodeQL查询,无需标注数据等,优化后查询的真阳性最多提升119.8%,还修复了长期悬而未决的问题并发现新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20342 2026-08-24 cs.AI cs.MA 新提交 79%

PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure

PrimeAgentOrchestrator:用于个人AI基础设施的内存初始化智能体生成器

Myron Koch (Peak Summit Labs)

机构 * Peak Summit Labs(峰汇实验室)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出PrimeAgentOrchestrator系统,生成预加载用户个人数据库相关记忆的Claude Code实例,并行查询两类记忆后端融合结果,管理智能体全生命周期,经四个月部署记录相关机制与工程权衡。

Comments 10 pages, 15 references, experience report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20370 2026-08-24 cs.DC cs.MA 新提交 78%

Benchmarking LLM Serving Systems for Agentic AI Workloads with XPerf

使用XPerf对智能体AI工作负载的大语言模型服务系统进行基准测试

Michael Wang, Yikang Yue, Shaobo Li, Yirui Eric Zhou, Chen Wang, Jian Huang

专题命中 软件智能体 :agentic(title,abstract)

AI总结 研究人员提出XPerf基准测试框架,可对智能体AI工作负载的LLM服务系统进行负载测试,能减少工作负载变化、提供性能分析并助力服务调试,将在GitHub开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20525 2026-08-24 cs.DB 新提交 75%

Bolo: Verified Model Hub for Next-Generation AI Databases

Bolo:面向下一代AI数据库的经验证的模型中心

Yunqi Li, Ila Petrovic, Yongjoo Park

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 该研究针对现有模型平台无法满足AI数据库需求的问题,提出基于多阶段智能体系统的Bolo模型平台,可将不可用模型权重转化为经验证的可用推理流水线,在实验中取得良好效果。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18970 2026-08-24 cs.SE cs.AI 版本更新 73%

Skillware: A Software Ontology and Engineering Lifecycle for Persistent Behavioral Artifacts

Skillware:用于持久行为工件的软件本体与工程生命周期

Haodi Fan, Zucong Lan

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对智能体技能成为持久行为工件却缺乏相关软件本体的问题,引入Skillware,通过Skill Artifact和Skillware Unit管理工件,阐述相关条件与证据,为智能体能力提供可识别、可组合、可维护及可演化的软件本体与工程生命周期。

Comments 26 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21101 2026-08-24 cs.CR cs.AI 新提交 70%

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

ClawSentry:一种用于保护自主大语言模型智能体的渐进式多层安全监控器

Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 ClawSentry是一种开源、与框架无关的智能体运行时安全监控网关,通过渐进式多层机制防护自主LLM智能体,可大幅降低攻击成功率,同时保持较高的任务安全率。

Comments 35 pages, 14 figures. Code: this https URL (https://github.com/Elroyper/ClawSentry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20412 2026-08-24 q-bio.GN 新提交 67%

PEN-STACK: A non-fabricating tool layer for language-model agents in genome writing

PEN-STACK:用于基因组写作的语言模型智能体的非制造工具层

Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

专题命中 软件智能体 :agent(abstract);agentic(abstract)

AI总结 本研究提出PEN-STACK工具层,为基因组写作的语言模型智能体提供可靠来源的工具,可消除数量伪造,经测试能提升生物安全,为智能体基因组工程系统提供了开源基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21356 2026-08-24 cs.SE cs.AI cs.AR cs.LO 新提交 62%

AI with Authority, from Application to Silicon

具备权威的AI:从应用到硅片

Jason Hickey

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出Salt方法,借助生成式AI与机器验证,在五周内由一名研究人员指挥AI智能体完成RISC-V处理器的流片,无人工审核证明与RTL,实现高效可靠的自主机器工作。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20664 2026-08-24 cs.AI cs.SE 新提交 62%

DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents

DreamBench-SWE:面向软件智能体的多会话记忆卫生基准

Sarthak Singh

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出面向软件智能体的多会话记忆卫生基准DreamBench-SWE,通过v2和预注册的v2.1审计,对比不同内存配置的任务完成表现,验证其作为可执行基准的有效性,同时明确相关内存机制的表现情况。

Comments 67 pages. Public benchmark and evidence release: this https URL (https://github.com/iroiro147/dreambench-swe/releases/tag/v2.1.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21311 2026-08-24 cs.SE 新提交 57%

AI-to-AI Code Reviews of GitHub Pull Requests

GitHub 拉取请求的 AI 对 AI 代码审查

Niruthiha Selvanayagam, Taher A. Ghaleb

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究构建大规模 AI 对 AI 代码审查数据集,分析 GitHub 上 AI 智能体生成 PR 的审查情况,发现跨产品审查占比约 1.6%且增速快,审查输出因配置而异,闭环 AI 对 AI 审查呈增长趋势但占比仍低。

Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20420 2026-08-24 cs.AI q-bio.NC 新提交 57%

Categorical AI phenomenology: A first-person approach

范畴论的AI现象学:一种第一人称进路

Robert Prentner

机构 * Institute of Humanities, ShanghaiTech University(上海科技大学人文学院) Association for Mathematical Consciousness Science(数学意识科学协会)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出一种以现象学为核心的人工意识研究进路,通过范畴论建模第一人称结构,将Q-networks视为智能体-世界交互的关系性接口,为接口意识提供严谨框架,契合4E认知方法。

Comments 38 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19100 2026-08-24 cs.SE 版本更新 57%

Reward Engineering for Software Tasks: A Survey of Reinforcement Learning Approaches

软件任务中强化学习的奖励工程

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez

专题命中 软件智能体 :autonomous agent(abstract);分类 cs.SE

AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21136 2026-08-24 cs.CV 新提交 50%

Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding

Stream3Dv2:几何-语义融合增强的流式零样本3D场景理解

Jie Xu, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 软件智能体 :agent(abstract)

AI总结 针对现有开放词汇零样本3D场景理解模型难以处理流式RGB-D输入、易受2D分割掩码噪声影响的问题,提出无训练框架Stream3Dv2,通过几何-语义融合等策略提升性能,在相关任务上优于基准,可与LLM智能体集成用于开放世界具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19816 2026-08-24 cs.CY 版本更新 50%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

Comments Changed first line of abstract

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2608.20379 2026-08-24 cs.AI 新提交 85%

A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications

多模态智能体框架的基础与前沿:技术及应用综述

Neel Mokaria, Rishie Raj, Dheeraj Baiju, Xiaoqian Shen, Shraman Pramanick, Kevin Qinghong Lin, Arda Senocak, Mike Zheng Shou, Philip Torr, Mohamed Elhoseiny, Yapeng Tian, Ruohan Gao, Salman Khan, Sayan Nag, Sanjoy Chowdhury, Dinesh Manocha

专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 本综述针对多模态在智能体框架核心模块的作用展开系统分析,梳理了其架构整合方式、应用领域及效率权衡,为通用智能系统研究指明方向。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20413 2026-08-24 q-bio.GN 新提交 78%

BioFirewall: A genome-writing-native governance layer for design-stage biosecurity screening of agentic AI

BioFirewall:面向智能体AI设计阶段生物安全筛查的基因组写入原生治理层

Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 针对智能体AI基因组编辑设计阶段的生物安全管控缺口,提出BioFirewall中间件,其在多维度筛查中表现优于大模型,能有效抵御攻击且假拒绝率低,已开源并附带可复现基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21326 2026-08-24 cs.CY 新提交 75%

Invisible Agents, Uninformed Patients: Towards Responsible Deployment Of Autonomous AI Diagnostic Agents In Sub-Saharan Africa

隐形智能体,不知情患者:撒哈拉以南非洲自主AI诊断智能体的负责任部署

Percy Brown, Kweku Yamoah

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文针对撒哈拉以南非洲自主AI诊断智能体部署中患者认知缺口与监管不足的问题,结合三地部署案例,提出三项基础原则以确立负责任部署的实用最低标准。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 11 篇

2608.21159 2026-08-24 cs.CR cs.AI 新提交 83%

AID-Guard: Stateful Authorization for Delegated Agent Effects

AID-Guard:面向委托智能体效应的有状态授权机制

Yingzhe Tong, Leyu Dai, Songhui Guo

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 AID-Guard是首个统一智能体授权生命周期控制的有状态协议,经多平台测试可阻止未授权效应,在保证安全性的同时可通过类型化前沿恢复部分效用。

Comments 18 pages, 8 figures, 13 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20400 2026-08-24 cs.AI cs.CL cs.LG 新提交 83%

When Retrieval Fails Before It Begins: Structurally Indirect Prerequisite Eviction as a Retention Failure in Agentic Memory

当检索尚未开始时检索就已失败:智能体记忆中作为保留失败的结构间接先决条件驱逐

Minkyu Song

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文针对智能体记忆的检索前保留失败问题,提出结构间接先决条件驱逐的概念,评估DSGC规则显著提升全链保留率,并发布相关工具支持机制分析。

Comments Accepted at the ICML 2026 Workshop on Failure Modes of Agentic AI (FAGEN@ICML 2026). Non-archival. Code: this https URL (https://github.com/smkgenesis/dsgc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20920 2026-08-24 cs.CL 新提交 79%

ForeDreamer: A Self-Evolving Dual-Agent Memory Architecture for Future Event Prediction

ForeDreamer:用于未来事件预测的自进化双智能体记忆架构

Linhao Zhong, Zongze Du, Linyu Wu, Yu Bo, Hourong Li, Chenchen Jing, Hao Chen, Yuling Xi, Chunhua Shen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) Zhejiang University of Technology(浙江工业大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 针对开放网络未来事件预测的不足,提出自进化双智能体框架ForeDreamer,分离事实与经验记忆,经Prophet Arena、FutureX实验验证其有效性

Comments accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20397 2026-08-24 cs.AI 新提交 79%

Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory

Nexus:面向统一内存上智能体大语言模型的深度自适应KV缓存拼接与检索解耦工具路由

Mustafa Arslan

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 Nexus针对MCP智能体LLM工具模式预填充主导TTFT的问题,通过检索解耦路由与预填充成本,结合深度自适应KV缓存拼接技术,实现了工具选择与参数生成的高效处理,提升了首token生成速度与上下文利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21230 2026-08-24 cs.CR cs.AI 新提交 74%

Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking

受攻击下的效用:智能体记忆投毒及内容筛选与来源排序的局限性

Arulnidhi Karunanidhi

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI

AI总结 该研究针对智能体记忆投毒问题,测试了内容筛选和来源排序的防御效果,发现仅内容筛选无法抵御投毒,来源加权检索也存在局限,主张采用有限占用约束并发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21156 2026-08-24 cs.IR cs.AI cs.ET 新提交 70%

Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence

大语言模型智能体时代的图工程:从个体智能到系统智能

Yuyuan Feng, Zhishang Xiang, Chaobin Yang, Qichao Ma, Zerui Chen, Yujing Zhang, Ke Huang, Chuanjie Wu, Zhaoxu Liu, Yili Wang, Xin He, Jiapu Wang, Zijin Hong, Hao Chen, Yuanchen Bei, Kun Wang, Shengyuan Chen, Ningyu Zhang, Enyan Dai, Linhao Luo, Qingyi Pan, Qi Wang, Wenqi Fan, Guangjing Wang, Na Zou, Yangqiu Song, Xin Wang, Zechao Li, Xia Hu, Qing Li, Xiao Huang, Zhihong Zhang, Jinsong Su, Qinggang Zhang, Yi Chang

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体复杂任务的个体智能局限,提出图工程范式,通过构建动态图结构组织协调异构智能体,为系统智能提供统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07107 2026-08-24 cs.AI 版本更新 70%

MemWM: Memory-Augmented Text-Based World Model

MemWM:记忆增强的基于文本的世界模型

Yujun Wang, Tao Zhang, Jinhe Bi, Aniri, Wenxuan Ye, Boliang Liu, Sikuan Yan, Shuning Wang, Xuebing Zhou, Sören Pirk, Hinrich Schütze, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究中心) Zhejiang University(浙江大学) Technical University of Munich (TUM)(慕尼黑工业大学) TU Berlin(柏林工业大学) Kiel University(基尔大学)

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29668 2026-08-24 cs.AI cs.CL 版本更新 62%

GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents

GRASP: 门控回归感知技能提议器用于自我改进的LLM智能体

Johannes Moll, Jean-Philippe Corbeil, Jiazhen Pan, Martin Hadamitzky, Daniel Rueckert, Lisa Adams, Keno Bressem

机构 * Technical University of Munich and TUM University Hospital(慕尼黑技术大学及慕尼黑大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出GRASP方法,通过门控回归感知技能库编辑,在硬回归预算下确保每次技能更新带来净改进,显著提升LLM智能体在结构化环境中的操作可靠性。

Comments Accepted at EMNLP 2026 (Main Conference). Code and data: this https URL (https://github.com/jomoll/GRASP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15508 2026-08-24 cs.LG cs.CL 版本更新 62%

STS: Efficient Sparse Attention with Speculative Token Sparsity

STS: 高效稀疏注意力与推测性标记稀疏性

Jiangnan Yu, Ceyu Xu, Yongji Wu, Yuan Xie

机构 * The Hong Kong University of Science and Technology(香港科技大学) UC Berkeley(加州大学伯克利分校)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STS,一种无需模型再训练的稀疏注意力机制,通过利用较小的草稿模型识别出的重要标记来预测更大目标模型的重要标记,从而在大规模语言模型推理中实现高效的稀疏注意力计算,显著提升速度并保持准确性。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20707 2026-08-24 cs.IR 新提交 50%

Towards Faithful Simulation of Human Shopping Behavior

面向人类购物行为的忠实模拟

Jiakai Tang, Yan Mi, Jing Yu, Yang Zhang, See-Kiong Ng, Qi Cao, Fei Sun, Xu Chen, Wen Chen, Jian Wu, Han Zhu, Bo Zheng

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏