arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-27 至 2026-08-27 共收录 205 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 20 篇

2608.25241 2026-08-27 cs.SE cs.AI 新提交 84%

A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption

几页Markdown:采用编码智能体后的已提交AI配置与更低质量成本

Yegor Denisov-Blanch, Shyam Agarwal, Pavel Azaletskiy, Hao He, Rylan Schaeffer, Brando Miranda, Bogdan Vasilescu, Sanmi Koyejo

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出RAMP四级AI成熟度模型,在441个代码库中验证其有效性,发现编码智能体可加速开发,且提交AI配置能降低认知复杂度与静态分析警告增幅。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26093 2026-08-27 cs.LG cs.IT cs.SY eess.SY math.IT 新提交 83%

Agentic Autoresearch for Cell-Edge Power Control: Radically Redefining the Researcher's Role

面向小区边缘功率控制的智能体自动研究:从根本上重新定义研究者的角色

Ahmad Khan, Akram Bin Sediq, Sara Azadegi Naeini, Raviraj S. Adve

机构 * Ericsson R&D(爱立信研发部门) University of Toronto(多伦多大学)

专题命中 软件智能体 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 该研究提出智能体自动研究协议,将无线资源管理的机器学习算法设计交由AI编码智能体完成,在小区边缘功率控制任务中实现高性能与低推理成本,还恢复了可证明的最优结构。

Comments Submitted to IEEE Globecom Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25927 2026-08-27 cs.CV cs.AI cs.CL 新提交 81%

Code World Model: Coding Agent as World Brain

代码世界模型:作为世界大脑的编码智能体

Yiwen Chen, Guosheng Lin, Chi Zhang

机构 * Westlake AGI Lab(西湖AGI实验室)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出Code World Model框架,以编码智能体为世界大脑生成可执行代码维持世界状态,结合视频模型实现视觉渲染,在游戏数据微调后取得良好效果,为开放式世界模型提供新路径。

Comments Project Page: https://buaacyw.github.io/cwm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25174 2026-08-27 cs.SE 新提交 79%

Model-Based Agentic Software Engineering

基于模型的智能体软件工程

James C. Davis, Kelechi Kalu, Huiyun Peng, Parth V. Patil

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 针对编码智能体无法明确项目关键信息的问题,提出MAGE框架及理论,通过外化表征与分配权威构建可信自主系统,经案例与工业案例验证,可将商用智能转化为持久工程进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21516 2026-08-27 cs.SE cs.PL 版本更新 79%

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning

神经形式化验证:智能体的语言无关形式化程序推理

Shuvendu K. Lahiri

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.SE

AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25202 2026-08-27 cs.SE cs.AI 新提交 79%

SPECMINE: A Large-Scale Corpus of Spec-Driven Development Artifacts

SPECMINE:一个大规模的规范驱动开发制品语料库

Shyam Agarwal, Bogdan Vasilescu

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 SPECMINE是一个大规模语料库,通过两次普查收集公共GitHub仓库中的规范驱动开发制品,含大量文件、PR及引用数据,助力研究AI智能体时代软件的规范过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25683 2026-08-27 cs.DC 新提交 78%

psRL: Efficient Training for Agentic AI via Training-Time Prefix Sharing

psRL:通过训练时前缀共享实现智能体AI的高效训练

Mianjie Yu, Zizhao Mo, Huanyu Qu, Zhirong Qian, Huanle Xu, Cen Li, Zifeng Zhao, Zhi Zhou, Jinhua Zhou, Jun Xie, Chengzhong Xu

专题命中 软件智能体 :agentic(title,abstract)

AI总结 psRL是利用训练样本前缀冗余的智能体AI训练系统,通过新颖前缀共享机制与KV缓存管理器提升分布式训练效率,吞吐量较现有系统最高提升5.2倍。

Comments 15 pages, 15 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10934 2026-08-27 cs.SE 版本更新 70%

Understanding the Architecture of Coding Agents: An Exploratory Study Using a Research Prototype

理解编码智能体的架构:一项使用研究原型的探索性研究

Marco Tulio Valente

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 本研究通过推出编码智能体Ark及基准ArkBench,探索了编码智能体的架构,用gpt-5.4-mini测试Ark解决10项任务中的8项,还对比了其与先进编码智能体的架构,为相关研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08462 2026-08-27 cs.CR cs.PL cs.SE 版本更新 70%

QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities

QLCoder:一种用于静态分析安全漏洞的查询生成器

Claire Wang, Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 QLCoder通过结合LLM与执行反馈,利用MCP接口生成有效的安全查询,有效检测漏洞。在111个Java项目中,53.4%的CVE被正确识别,优于仅使用Claude Code的10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25817 2026-08-27 cs.CR 新提交 67%

SkillShield: Prompt-Space Security Skills for LLM Coding Agents

SkillShield:面向LLM编码智能体的提示空间安全技能

Xiaodong Wu, Zhimin Zhao, Qi Li, Xiangman Li, Yu Shi, Bram Adams, Jianbing Ni

专题命中 软件智能体 :agent(abstract);tool-use(abstract)

AI总结 SkillShield是一种系统提示防御机制,通过离线合成安全技能注入系统提示,可有效降低LLM编码智能体的恶意软件生成成功率,在多项实验中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25661 2026-08-27 cs.SE cs.AI 新提交 62%

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

从通用智能体到RCA专家:一种用于根因分析的自演化框架

Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出自演化RCA框架OpsHarness,复用通用智能体能力,通过双门验证演化,在基准与工业场景中大幅提升RCA准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21356 2026-08-27 cs.SE cs.AI cs.AR cs.LO 版本更新 62%

AI with Authority, from Application to Silicon

具备权威的AI:从应用到硅片

Jason Hickey

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出Salt方法,借助生成式AI与机器验证,在五周内由一名研究人员指挥AI智能体完成RISC-V处理器的流片,无人工审核证明与RTL,实现高效可靠的自主机器工作。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2026-08-27 cs.CL cs.SE 版本更新 62%

Scalable Supervision for Software Agents via Patch Reasoning

基于补丁推理的软件智能体可扩展监督

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 针对现有基于测试的软件智能体监督可扩展性不足的问题,提出R4P推理方法,在SWE-bench补丁验证中准确率达72.2%,训练的Mini-SE在Pass@1上较Qwen3-32B提升10.0%至26.2%。

Comments EMNLP'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25776 2026-08-27 cs.CR cs.AI 新提交 57%

EVOMAL: Self-Poisoning in Self-Evolving Coding Agents

EVOMAL:自进化编码智能体中的自中毒

Xiaodong Wu, Yu Shi, Qi Li, Zhimin Zhao, Xiangman Li, Bram Adams, Ahmed E. Hassan, Jianbing Ni

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究发现自进化编码智能体存在自中毒漏洞,提出EvoMal攻击可实现自传播恶意技能,而counter-prompt防御能有效降低攻击成功率且不影响任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09156 2026-08-27 cs.LG 版本更新 57%

Activation Steering Transfer to Agents: One Gain Ratio Does Not Identify Potency and Efficacy

存在但重新缩放:加法激活引导的聊天到智能体的转移

Lucas Pinto

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。

Comments v2 changes the estimand from a gain ratio to a curve location and supersedes v1's coupling-distribution reading. 40 pages, 7 figures, 5 tables. Includes an errata section correcting v1's public record. Code and pre-registrations: github.com/digdoug/steering-dose-reparametrization

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25592 2026-08-27 stat.ML cs.LG 版本更新 57%

Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification

多项Logit模型的最优设计及其在最佳组合识别中的应用

Joongkyu Lee, Min-hwan Oh

机构 * Seoul National University, Seoul, Korea(首尔国立大学)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 针对多项Logit(MNL)模型,提出计算高效的最优实验设计框架,通过混合整数线性规划和多项式时间松弛方法实现统计效率与可扩展性,并应用于线性效用和非均匀收益下的最佳组合识别。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-08-27 cs.AI 版本更新 57%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

Comments 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09586 2026-08-27 cs.AI 版本更新 57%

EvoCurr: Self-evolving Curriculum with Behavior Code Generation for Complex Decision-making

EvoCurr:面向复杂决策的、结合行为代码生成的自演进课程框架

Yang Cheng, Weiyu Ma, Zilai Wang, Wenhui Zhu, Tangjie Lv, Yujing Hu, Mohamed Elhoseiny, Yue Deng, Jian Zhao

机构 * Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 提出EvoCurr这一推理时框架,协同演进课程与可执行策略,在《星际争霸II》等任务上实现高胜率,且具有通用性,无需训练LLM参数。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 6 篇

2608.25176 2026-08-27 cs.CV cs.LG eess.IV 新提交 74%

Lowering the Barrier to AI-Driven Inspection: A No-Code Workflow for Automated Structural Defect Detection

降低AI驱动检测的门槛:用于自动化结构缺陷检测的无代码工作流

Michael Holm, Tanner McElroy, Xinghang Zhang, Guang Lin

机构 * Purdue University(普渡大学)

专题命中 GUI与网页智能体 :workflow(title);分类 cs.LG

AI总结 针对AI驱动结构缺陷检测的技术门槛问题,推出基于GUI的开源无代码工具YOLOEZ,集成数据标注、训练与推理,其性能优于传统方法,可降低AI在结构健康监测中的应用门槛。

Comments 11 pages, 7 figures. Accepted to ASME SMASIS 2026 (paper SMASIS2026-190654). Software available at https://github.com/michaelholm6/YOLOEZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25777 2026-08-27 cs.AI 新提交 70%

LocalLSTC: A Long Short-Term Control Architecture for Locally Deployed GUI Agents

LocalLSTC:面向本地部署GUI智能体的长短期控制架构

Weiming Li, Helen Paik, Yulei Sui

机构 * School of Computer Science and Engineering(计算机科学与工程学院) The University of New South Wales(新南威尔士大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文针对本地部署GUI智能体的控制信息隐含问题,提出无需训练的LocalLSTC架构,在OSWorld和WindowsAgentArena基准上均取得优于现有本地方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24898 2026-08-27 cs.HC cs.AI 新提交 70%

MCP-Driven Accessibility Tree Standardization for AI-Powered Screen Reader Agents

基于MCP的AI驱动屏幕阅读器智能体的可访问性树标准化

Vishnu Ramineni, Nitin Saksena, Akash Kumar Agarwal, Darshan Mohan Bidkar, Balakrishna Pothineni, Durgaraman Maruthavanan, Lokesh Butra, Siva Kumar Chintham

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出基于MCP的统一可访问性层架构,解决LLM智能体跨平台可访问性感知的集成复杂性问题,为可访问AI智能体提供语义信息基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25178 2026-08-27 cs.CV cs.AI 新提交 57%

Lightweight Machine Learning-Driven Monocular Sidewalk Path Extraction for Embedded Micromobility Navigation

面向嵌入式微型移动导航的轻量级机器学习驱动单目人行道路径提取

Lkhanaajav Mijiddorj, Yang Yan, Tyler Beringer, Bilguunzaya Mijiddorj, Alex N. Ho, Bin Xu, Binbin Weng

机构 * University of Oklahoma(俄克拉荷马大学) School of Electrical and Computer Engineering(电气与计算机工程学院) School of Aerospace and Mechanical Engineering(航空航天与机械工程学院)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 该研究针对嵌入式微型移动导航的人行道路径提取问题,提出历经三次迭代的单目视觉流水线,采用轻量级SegFormer-B0模型,通过对比规划方法,实现低耗时、高精度的路径提取,适配嵌入式设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25799 2026-08-27 cs.RO 新提交 50%

AGRO-Nav: Autonomous Graph-based Orchard Navigation

AGRO-Nav:基于自主图的果园导航

Ho Young Yun, Jaemin Yu, Duksu Kim

机构 * School of Computer Engineering, Korea University of Technology and Education (KOREATECH)(韩国技术教育大学计算机工程学院(KOREATECH))

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对果园半结构化环境中网格规划器易偏离行中心的问题,提出 AGRO-Nav 框架,通过 SLAM 点云构建拓扑图并结合 Dijkstra 搜索等算法规划路径,在真实和仿真环境中均表现出更高精度与规划效率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25610 2026-08-27 cs.RO 新提交 50%

Advantage-Driven Explicit Memory for Social Navigation

面向社交导航的优势驱动型显式记忆

Yeonsoo Park, Mattia Racca, Guillaume Bono, Steeven Janny, Gianluca Monaci, Tomi Silander, Christian Wolf

机构 * Seoul National University(首尔大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究针对社交导航任务,提出将非参数化显式记忆集成到循环PPO架构,利用RL优势信号保留关键事件,提升智能体泛化能力与对分布外社交行为的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 18 篇

2608.26013 2026-08-27 cs.CL 新提交 85%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yawei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21725 2026-08-27 cs.CL cs.AI cs.CE 版本更新 84%

AEL: Evolving Agent Harness in Open-Ended Environments

AEL:开放环境中演化的智能体 harness

Wujiang Xu, Jiaojiao Han, Minghao Guo, Kai Mei, Xi Zhu, Han Zhang, Dimitris N. Metaxas

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究提出双时间尺度框架AEL,将记忆使用转化为在线策略选择,在顺序投资组合和支持工单路由任务中均显著优于多种基线方法,性能提升具有因果性。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25500 2026-08-27 cs.AI cs.CL 新提交 84%

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

CaSKG:用于可扩展智能体技能检索的反事实因果技能图

Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Ant Group(蚂蚁集团)

专题命中 记忆与上下文管理 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出CaSKG框架,通过构建并校准反事实因果技能图实现可扩展智能体技能检索,在6种LLM骨干模型的两个基准测试中均取得最高任务得分,显著优于Graph-of-Skills。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-08-27 cs.CL cs.AI 版本更新 84%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 记忆与上下文管理 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

Comments EMNLP 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25462 2026-08-27 cs.HC cs.GR 新提交 82%

TailorCoPilot: Enabling Agentic Pattern Making with Version-Controlled State Tracking

TailorCoPilot:实现带版本控制状态跟踪的智能体式制版

Yuexin Sun, Zhaohui Wang, Ruiyang Liu, Demian Kong, Qian He, Gaofeng He, Huamin Wang

专题命中 记忆与上下文管理 :agentic(title,abstract);workflow(abstract)

AI总结 TailorCoPilot是基于TailorTrace版本控制后端的智能体式制版系统,可记录专家隐性制版知识,在用户研究中提升了新手的制版任务表现,为生成式AI和学徒制提供支持。

Comments To appear in UIST 2026.Corresponding author: Zhaohui Wang. Project leader: Ruiyang Liu

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25553 2026-08-27 cs.IR cs.AI cs.CL 新提交 81%

When Stale Constraints Go Unchecked: Budgeted Verification Failures in Inherited Agent Memory

当过时约束未被核查:智能体继承记忆中的带预算验证失败

Kazuki Nakayashiki

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究针对智能体继承记忆中过时约束未被核查的问题,建模替代机制,发现重新分配预算槽位给关键路径可显著提升当前记录一致的决策,为记忆系统设计提供了参考。

Comments 18 pages, 3 figures, 7 tables. Manuscript, LaTeX source, all 5,400 episode files, frozen specifications, timestamp proofs, analysis and generator scripts are archived at Zenodo: doi:10.5281/zenodo.22108558

详情

展开后加载摘要…

URL PDF HTML 收藏