arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-24 至 2026-08-24 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 18 篇

2512.03262 2026-08-24 cs.SE cs.CL 版本更新 86%

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li

机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学) HydroX AI

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.CL、cs.SE

AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20711 2026-08-24 cs.CL 新提交 83%

AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification

AsmEvo:采用功能等价性验证的AMD GPU内核智能体级汇编层优化工具

Ji Liu, Puyuan Yang, Rongzhang Zheng, Fan Wang, Jinglin Wang, Muhammad A. Awad, Mortis Huang, Andy Chang, Zekai Li, Zeping Li, Zihao An, Yue Liu, Yuchen Yang, Jianghui Wang, Chushi Chen, Ziqiong Liu, Fuwei Yang, Dong Li, Wen Heng Chung, Shengcai Liu, Emad Barsoum

机构 * AMD(超威半导体公司)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 AsmEvo是一款针对AMD GPU内核的智能体级汇编层优化工具,通过功能等价性验证优化已编译的AMDGPU代码对象,在多款AMD GPU上实现了显著加速比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20566 2026-08-24 cs.LG 新提交 83%

AgentDecarbonizer: Carbon-Aware Execution for AI Agents

AgentDecarbonizer:面向AI智能体的碳感知执行方案

Leyi Yan, Shuangning Li, Sihang Liu

机构 * University of Waterloo(滑铁卢大学) University of Chicago(芝加哥大学)

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文针对AI智能体工作流碳排放高的问题,提出AgentDecarbonizer碳优化器,可结合截止日期、电网碳强度等选择调度方案,在WildClawBench上最多降低57.9%碳排放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20749 2026-08-24 cs.CV 新提交 82%

Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

通过智能体增强与语义修复实现身份保留的文本到视频生成

Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 软件智能体 :agentic(title,abstract)

AI总结 针对现有商业视频生成模型的身份漂移等缺陷,提出AESR轻量级框架,含智能体提示增强与视觉语义修复模块,搭配混合专家选择策略,其系统MIPL_Video在ACM MM 2026挑战赛赛道1获第一

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20637 2026-08-24 cs.CR cs.AI 新提交 79%

ARQ: Agentic CodeQL Query Refinement for C/C++ Vulnerability Detection

ARQ:用于C/C++漏洞检测的智能CodeQL查询优化框架

Chunyi Wang, Yunfei Ke, Junfeng Yang, Yun-Yun Tsai, Penghui Li

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ARQ智能框架,利用合成C/C++程序的执行证据和LLM优化CodeQL查询,无需标注数据等,优化后查询的真阳性最多提升119.8%,还修复了长期悬而未决的问题并发现新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20342 2026-08-24 cs.AI cs.MA 新提交 79%

PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure

PrimeAgentOrchestrator:用于个人AI基础设施的内存初始化智能体生成器

Myron Koch (Peak Summit Labs)

机构 * Peak Summit Labs(峰汇实验室)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出PrimeAgentOrchestrator系统,生成预加载用户个人数据库相关记忆的Claude Code实例,并行查询两类记忆后端融合结果,管理智能体全生命周期,经四个月部署记录相关机制与工程权衡。

Comments 10 pages, 15 references, experience report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20370 2026-08-24 cs.DC cs.MA 新提交 78%

Benchmarking LLM Serving Systems for Agentic AI Workloads with XPerf

使用XPerf对智能体AI工作负载的大语言模型服务系统进行基准测试

Michael Wang, Yikang Yue, Shaobo Li, Yirui Eric Zhou, Chen Wang, Jian Huang

专题命中 软件智能体 :agentic(title,abstract)

AI总结 研究人员提出XPerf基准测试框架,可对智能体AI工作负载的LLM服务系统进行负载测试,能减少工作负载变化、提供性能分析并助力服务调试,将在GitHub开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20525 2026-08-24 cs.DB 新提交 75%

Bolo: Verified Model Hub for Next-Generation AI Databases

Bolo:面向下一代AI数据库的经验证的模型中心

Yunqi Li, Ila Petrovic, Yongjoo Park

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 该研究针对现有模型平台无法满足AI数据库需求的问题,提出基于多阶段智能体系统的Bolo模型平台,可将不可用模型权重转化为经验证的可用推理流水线,在实验中取得良好效果。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18970 2026-08-24 cs.SE cs.AI 版本更新 73%

Skillware: A Software Ontology and Engineering Lifecycle for Persistent Behavioral Artifacts

Skillware:用于持久行为工件的软件本体与工程生命周期

Haodi Fan, Zucong Lan

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对智能体技能成为持久行为工件却缺乏相关软件本体的问题,引入Skillware,通过Skill Artifact和Skillware Unit管理工件,阐述相关条件与证据,为智能体能力提供可识别、可组合、可维护及可演化的软件本体与工程生命周期。

Comments 26 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21101 2026-08-24 cs.CR cs.AI 新提交 70%

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

ClawSentry:一种用于保护自主大语言模型智能体的渐进式多层安全监控器

Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 ClawSentry是一种开源、与框架无关的智能体运行时安全监控网关,通过渐进式多层机制防护自主LLM智能体,可大幅降低攻击成功率,同时保持较高的任务安全率。

Comments 35 pages, 14 figures. Code: this https URL (https://github.com/Elroyper/ClawSentry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20412 2026-08-24 q-bio.GN 新提交 67%

PEN-STACK: A non-fabricating tool layer for language-model agents in genome writing

PEN-STACK:用于基因组写作的语言模型智能体的非制造工具层

Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

专题命中 软件智能体 :agent(abstract);agentic(abstract)

AI总结 本研究提出PEN-STACK工具层,为基因组写作的语言模型智能体提供可靠来源的工具,可消除数量伪造,经测试能提升生物安全,为智能体基因组工程系统提供了开源基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21356 2026-08-24 cs.SE cs.AI cs.AR cs.LO 新提交 62%

AI with Authority, from Application to Silicon

具备权威的AI:从应用到硅片

Jason Hickey

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出Salt方法,借助生成式AI与机器验证,在五周内由一名研究人员指挥AI智能体完成RISC-V处理器的流片,无人工审核证明与RTL,实现高效可靠的自主机器工作。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20664 2026-08-24 cs.AI cs.SE 新提交 62%

DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents

DreamBench-SWE:面向软件智能体的多会话记忆卫生基准

Sarthak Singh

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出面向软件智能体的多会话记忆卫生基准DreamBench-SWE,通过v2和预注册的v2.1审计,对比不同内存配置的任务完成表现,验证其作为可执行基准的有效性,同时明确相关内存机制的表现情况。

Comments 67 pages. Public benchmark and evidence release: this https URL (https://github.com/iroiro147/dreambench-swe/releases/tag/v2.1.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21311 2026-08-24 cs.SE 新提交 57%

AI-to-AI Code Reviews of GitHub Pull Requests

GitHub 拉取请求的 AI 对 AI 代码审查

Niruthiha Selvanayagam, Taher A. Ghaleb

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究构建大规模 AI 对 AI 代码审查数据集,分析 GitHub 上 AI 智能体生成 PR 的审查情况,发现跨产品审查占比约 1.6%且增速快,审查输出因配置而异,闭环 AI 对 AI 审查呈增长趋势但占比仍低。

Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20420 2026-08-24 cs.AI q-bio.NC 新提交 57%

Categorical AI phenomenology: A first-person approach

范畴论的AI现象学:一种第一人称进路

Robert Prentner

机构 * Institute of Humanities, ShanghaiTech University(上海科技大学人文学院) Association for Mathematical Consciousness Science(数学意识科学协会)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出一种以现象学为核心的人工意识研究进路,通过范畴论建模第一人称结构,将Q-networks视为智能体-世界交互的关系性接口,为接口意识提供严谨框架,契合4E认知方法。

Comments 38 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19100 2026-08-24 cs.SE 版本更新 57%

Reward Engineering for Software Tasks: A Survey of Reinforcement Learning Approaches

软件任务中强化学习的奖励工程

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez

专题命中 软件智能体 :autonomous agent(abstract);分类 cs.SE

AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21136 2026-08-24 cs.CV 新提交 50%

Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding

Stream3Dv2:几何-语义融合增强的流式零样本3D场景理解

Jie Xu, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 软件智能体 :agent(abstract)

AI总结 针对现有开放词汇零样本3D场景理解模型难以处理流式RGB-D输入、易受2D分割掩码噪声影响的问题,提出无训练框架Stream3Dv2,通过几何-语义融合等策略提升性能,在相关任务上优于基准,可与LLM智能体集成用于开放世界具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19816 2026-08-24 cs.CY 版本更新 50%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

Comments Changed first line of abstract

详情

展开后加载摘要…

URL PDF HTML 收藏