arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-27 至 2026-08-27 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 20 篇

2608.25593 2026-08-27 cs.CL cs.LG 新提交 92%

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

JIT-Agent:通过即时测试框架演进扩展测试框架智能

Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan

机构 * LV-NUS Lab(LV-NUS实验室)

专题命中 软件智能体 :agent(title,title_cn);planning(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 JIT-Agent是首个专为即时生成智能体测试框架设计的模型,可定制、修复、自我演进测试框架,提升DeepSeek、GLM等模型在多基准任务的性能,确立测试框架智能为智能体能力的独立可扩展维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23602 2026-08-27 cs.AR 版本更新 85%

PACT: Post-route Agentic Checkpoint Tuning for FPGA Timing Closure

PACT:面向FPGA时序收敛的后路由代理检查点调优

Huan Lin, Kunlong Li, Lingli Wang, Zhiang Wang

专题命中 软件智能体 :agentic(title,abstract);agent(abstract,abstract_cn)

AI总结 本文提出PACT框架,用于Vivado设计检查点的后路由调优,在35个UltraScale+检查点上将F_max几何平均提升22.30%,速度较DATuner快6.4倍,令牌成本仅0.16美元/ DCP。

Comments Accepted to the 2026 International Conference on Field-Programmable Technology (FPT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25241 2026-08-27 cs.SE cs.AI 新提交 84%

A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption

几页Markdown:采用编码智能体后的已提交AI配置与更低质量成本

Yegor Denisov-Blanch, Shyam Agarwal, Pavel Azaletskiy, Hao He, Rylan Schaeffer, Brando Miranda, Bogdan Vasilescu, Sanmi Koyejo

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出RAMP四级AI成熟度模型,在441个代码库中验证其有效性,发现编码智能体可加速开发,且提交AI配置能降低认知复杂度与静态分析警告增幅。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26093 2026-08-27 cs.LG cs.IT eess.SY 新提交 83%

Agentic Autoresearch for Cell-Edge Power Control: Radically Redefining the Researcher's Role

面向小区边缘功率控制的智能体自动研究:从根本上重新定义研究者的角色

Ahmad Khan, Akram Bin Sediq, Sara Azadegi Naeini, Raviraj S. Adve

机构 * Ericsson R&D(爱立信研发部门) University of Toronto(多伦多大学)

专题命中 软件智能体 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 该研究提出智能体自动研究协议,将无线资源管理的机器学习算法设计交由AI编码智能体完成,在小区边缘功率控制任务中实现高性能与低推理成本,还恢复了可证明的最优结构。

Comments Submitted to IEEE Globecom Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25927 2026-08-27 cs.CV cs.AI cs.CL 新提交 81%

Code World Model: Coding Agent as World Brain

代码世界模型:作为世界大脑的编码智能体

Yiwen Chen, Guosheng Lin, Chi Zhang

机构 * Westlake AGI Lab(西湖AGI实验室)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出Code World Model框架,以编码智能体为世界大脑生成可执行代码维持世界状态,结合视频模型实现视觉渲染,在游戏数据微调后取得良好效果,为开放式世界模型提供新路径。

Comments Project Page: this https URL (https://buaacyw.github.io/cwm/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25174 2026-08-27 cs.SE 新提交 79%

Model-Based Agentic Software Engineering

基于模型的智能体软件工程

James C. Davis, Kelechi Kalu, Huiyun Peng, Parth V. Patil

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 针对编码智能体无法明确项目关键信息的问题,提出MAGE框架及理论,通过外化表征与分配权威构建可信自主系统,经案例与工业案例验证,可将商用智能转化为持久工程进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21516 2026-08-27 cs.SE cs.PL 版本更新 79%

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning

神经形式化验证:智能体的语言无关形式化程序推理

Shuvendu K. Lahiri

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.SE

AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25202 2026-08-27 cs.SE cs.AI 新提交 79%

SPECMINE: A Large-Scale Corpus of Spec-Driven Development Artifacts

SPECMINE:一个大规模的规范驱动开发制品语料库

Shyam Agarwal, Bogdan Vasilescu

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 SPECMINE是一个大规模语料库,通过两次普查收集公共GitHub仓库中的规范驱动开发制品,含大量文件、PR及引用数据,助力研究AI智能体时代软件的规范过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25683 2026-08-27 cs.DC 新提交 78%

psRL: Efficient Training for Agentic AI via Training-Time Prefix Sharing

psRL:通过训练时前缀共享实现智能体AI的高效训练

Mianjie Yu, Zizhao Mo, Huanyu Qu, Zhirong Qian, Huanle Xu, Cen Li, Zifeng Zhao, Zhi Zhou, Jinhua Zhou, Jun Xie, Chengzhong Xu

专题命中 软件智能体 :agentic(title,abstract)

AI总结 psRL是利用训练样本前缀冗余的智能体AI训练系统,通过新颖前缀共享机制与KV缓存管理器提升分布式训练效率,吞吐量较现有系统最高提升5.2倍。

Comments 15 pages, 15 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10934 2026-08-27 cs.SE 版本更新 70%

Understanding the Architecture of Coding Agents: An Exploratory Study Using a Research Prototype

理解编码智能体的架构:一项使用研究原型的探索性研究

Marco Tulio Valente

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 本研究通过推出编码智能体Ark及基准ArkBench,探索了编码智能体的架构,用gpt-5.4-mini测试Ark解决10项任务中的8项,还对比了其与先进编码智能体的架构,为相关研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08462 2026-08-27 cs.CR cs.PL cs.SE 版本更新 70%

QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities

QLCoder:一种用于静态分析安全漏洞的查询生成器

Claire Wang, Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 QLCoder通过结合LLM与执行反馈,利用MCP接口生成有效的安全查询,有效检测漏洞。在111个Java项目中,53.4%的CVE被正确识别,优于仅使用Claude Code的10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25817 2026-08-27 cs.CR 新提交 67%

SkillShield: Prompt-Space Security Skills for LLM Coding Agents

SkillShield:面向LLM编码智能体的提示空间安全技能

Xiaodong Wu, Zhimin Zhao, Qi Li, Xiangman Li, Yu Shi, Bram Adams, Jianbing Ni

专题命中 软件智能体 :agent(abstract);tool-use(abstract)

AI总结 SkillShield是一种系统提示防御机制,通过离线合成安全技能注入系统提示,可有效降低LLM编码智能体的恶意软件生成成功率,在多项实验中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25661 2026-08-27 cs.SE cs.AI 新提交 62%

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

从通用智能体到RCA专家:一种用于根因分析的自演化框架

Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出自演化RCA框架OpsHarness,复用通用智能体能力,通过双门验证演化,在基准与工业场景中大幅提升RCA准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21356 2026-08-27 cs.SE cs.AI cs.AR cs.LO 版本更新 62%

AI with Authority, from Application to Silicon

具备权威的AI:从应用到硅片

Jason Hickey

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出Salt方法,借助生成式AI与机器验证,在五周内由一名研究人员指挥AI智能体完成RISC-V处理器的流片,无人工审核证明与RTL,实现高效可靠的自主机器工作。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2026-08-27 cs.CL cs.SE 版本更新 62%

Scalable Supervision for Software Agents via Patch Reasoning

基于补丁推理的软件智能体可扩展监督

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 针对现有基于测试的软件智能体监督可扩展性不足的问题,提出R4P推理方法,在SWE-bench补丁验证中准确率达72.2%,训练的Mini-SE在Pass@1上较Qwen3-32B提升10.0%至26.2%。

Comments EMNLP'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25776 2026-08-27 cs.CR cs.AI 新提交 57%

EVOMAL: Self-Poisoning in Self-Evolving Coding Agents

EVOMAL:自进化编码智能体中的自中毒

Xiaodong Wu, Yu Shi, Qi Li, Zhimin Zhao, Xiangman Li, Bram Adams, Ahmed E. Hassan, Jianbing Ni

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究发现自进化编码智能体存在自中毒漏洞,提出EvoMal攻击可实现自传播恶意技能,而counter-prompt防御能有效降低攻击成功率且不影响任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09156 2026-08-27 cs.LG 版本更新 57%

Activation Steering Transfer to Agents: One Gain Ratio Does Not Identify Potency and Efficacy

存在但重新缩放:加法激活引导的聊天到智能体的转移

Lucas Pinto

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。

Comments v2 changes the estimand from a gain ratio to a curve location and supersedes v1's coupling-distribution reading. 40 pages, 7 figures, 5 tables. Includes an errata section correcting v1's public record. Code and pre-registrations: this http URL (http://github.com/digdoug/steering-dose-reparametrization)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25592 2026-08-27 stat.ML cs.LG 版本更新 57%

Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification

多项Logit模型的最优设计及其在最佳组合识别中的应用

Joongkyu Lee, Min-hwan Oh

机构 * Seoul National University, Seoul, Korea(首尔国立大学)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 针对多项Logit(MNL)模型,提出计算高效的最优实验设计框架,通过混合整数线性规划和多项式时间松弛方法实现统计效率与可扩展性,并应用于线性效用和非均匀收益下的最佳组合识别。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-08-27 cs.AI 版本更新 57%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

Comments 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09586 2026-08-27 cs.AI 版本更新 57%

EvoCurr: Self-evolving Curriculum with Behavior Code Generation for Complex Decision-making

EvoCurr:面向复杂决策的、结合行为代码生成的自演进课程框架

Yang Cheng, Weiyu Ma, Zilai Wang, Wenhui Zhu, Tangjie Lv, Yujing Hu, Mohamed Elhoseiny, Yue Deng, Jian Zhao

机构 * Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 提出EvoCurr这一推理时框架,协同演进课程与可执行策略,在《星际争霸II》等任务上实现高胜率,且具有通用性,无需训练LLM参数。

详情

展开后加载摘要…

URL PDF HTML 收藏