arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-25 至 2026-08-25 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 22 篇

2608.23395 2026-08-25 cs.MA cs.AI cs.SE 新提交 88%

Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep

增值税判定(VAT Determination)中大型语言模型智能体(LLM-Agent)分解的规模适配:一项试点控制扫描研究

Pedro Santos

专题命中 软件智能体 :agent(title,title_cn);分类 cs.AI、cs.SE

AI总结 本试点研究在带反向收费的跨境增值税判定场景中,对比不同LLM智能体分解配置,发现中间配置准确率领先但未达标准,提出分解规模适配启发式方法并发布相关资源。

Comments 29 pages, 4 figures. Code, data, and traces: this https URL (https://github.com/pedro-santos-eng/Right-sizing-LLM-agent-decomposition-in-VAT-determination)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21942 2026-08-25 cs.AI cs.CR cs.MA cs.NI 新提交 85%

TessIndex: Capability Verified Identity System for the Agent Economy

TessIndex:面向智能体经济的能力验证身份系统

Mehul Goenka, Tejas Pathak, Siddharth Asthana

机构 * University of Oxford(牛津大学) Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 针对智能体经济基础设施的三大缺陷,提出采用双平面架构的TessIndex系统,实现智能体原语的持久身份、可验证能力声明及价值捕获,为智能体经济提供集成化身份支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19066 2026-08-25 cs.SE cs.AI 版本更新 84%

Dynamic Cogeneration of Bug Reproduction Test in Agentic Program Repair

代理程序修复中的动态共生测试生成

Runxiang Cheng, Michele Tufano, José Cambronero, Renyao Wei, Sherry Shi, Grant Uy, Pat Rondon, Franjo Ivančić

机构 * Google, USA(谷歌(美国))

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了在程序修复中动态共生生成测试的方法,通过在同一补丁中生成修复和测试用例,提高修复的可信度并减少维护成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23041 2026-08-25 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 83%

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

AutoSaddler:基于智能体执行轨迹的持久化更新的自动工具优化

Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * KAIST(韩国科学技术院) Southern University of Science and Technology(南方科技大学) Microsoft(微软) POSTECH(浦项科技大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 AutoSaddler是基于智能体执行轨迹的自动工具优化框架,通过离线学习结合故障诊断等技术,在多个基准上提升智能体性能9.0-10.0个百分点,为构建更可靠的智能体系统提供了新方向。

Comments 44 pages, 15 figures. Project website and code: this https URL (https://aka.ms/AutoSaddler-website)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11864 2026-08-25 cs.IR 版本更新 82%

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

CORE-Bench:智能体编程时代代码检索的综合基准

Fuwei Zhang, Yanzhao Zhang, Mingxin Li, Dingkun Long, Lexiang Hu, Pengjun Xie, Zhao Zhang, Fuzhen Zhuang

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。

Comments Accepted By EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23564 2026-08-25 cs.CL cs.AI cs.SE 新提交 80%

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

SWE Refactor Bench:编码智能体能完成长周期的全仓库栈迁移吗?

Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

机构 * Navers Lab(Navers实验室) Tsinghua University(清华大学)

专题命中 软件智能体 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究推出SWE Refactor Bench基准,通过三阶段评估发现前沿编码智能体仅5.4%能完成全仓库迁移,且迁移完整性与行为正确性是不同能力,该基准可作为可靠全仓库迁移编码智能体的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21516 2026-08-25 cs.SE cs.PL 新提交 79%

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning

神经形式化验证:智能体的语言无关形式化程序推理

Shuvendu K. Lahiri

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.SE

AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-25 cs.SE 新提交 77%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22884 2026-08-25 cs.MA cs.SI 新提交 71%

Predicting the scale limits of social mechanisms in agent societies

预测智能体社会中社会机制的规模极限

Zengqing Wu, Chuan Xiao

专题命中 软件智能体 :agent(title)

AI总结 本文针对智能体社会中社会机制的规模极限问题,提出一种审计方法,通过受控实验确定互惠等机制的规模存续条件,验证了预测方法的有效性,为跨群体规模解读社会机制提供了前瞻性手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21747 2026-08-25 cs.SE cs.AI cs.CL 新提交 67%

Architecture as Capability Equalizer for Coding Agents

架构作为编码智能体的能力均衡器

Arquimedes Canedo

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 该研究对比5种架构规范格式对6种LLM编码智能体的代码生成质量影响,发现结构化格式可作为能力均衡器,显著提升弱模型性能,对成本优化部署价值最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22191 2026-08-25 cs.AI cs.SE 新提交 62%

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

探索时持异议,提交时持共识:面向软件智能体的路由引导测试时缩放

Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 软件智能体 :tool-use(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对软件智能体测试时缩放难题,提出Risa方法,利用MoE路由轨迹引导探索与仲裁,在SWE-bench等基准上提升了仓库级软件工程任务的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21964 2026-08-25 cs.AI cs.SE 新提交 62%

Repo2Skill-Evo: Repository Skills Go Stale in Silence

Repo2Skill-Evo:仓库技能在静默中过时

Chenyuan Duan, Ge Shi, Zineng Mao, Ge Zhang, Hao Liang, Yinzhu Piao, Yuchen Wu, Zhixin Yao, Kaiyu Huang, Wenhao Huang, Linzhuang Sun, Shen Yan, Wentao Zhang

机构 * ByteDance(字节跳动) Peking University(北京大学) Beijing Jiaotong University(北京交通大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 Repo2Skill-Evo研究发现,在57个真实仓库的105次版本转换中,前沿智能体难以可靠维护仓库技能,其平均@3 macro F1仅29.9%-69.7%,仓库技能会在无明确信号的情况下静默过时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21833 2026-08-25 cs.AI cs.CL 新提交 62%

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Lightspeed Studios, Tencent(腾讯光速工作室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22960 2026-08-25 cs.AI 新提交 57%

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels

代码智能体的过程评估实际测量什么:动作、任务和步骤是三个不同的层级

Jiawei He, Mengyu Shi, Jie jia, Xikai Yang, Dong Sun

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出代码智能体过程评估的测量框架,用SCAE实现步骤级因果归因,经499个文件定位场景实验发现当前过程评估多测量语义相关性而非因果贡献。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21929 2026-08-25 cs.CR cs.CL 新提交 57%

SkillBloat: Token Amplification Attacks via Skill Injection in LLM Coding Agents

SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击

Yuanjin Zheng, Jingbang Chen

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21417 2026-08-25 cs.AI cs.RO 新提交 57%

Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol

基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议

Zhichao Zhou, Siyuan Chen, Omkar Salunkhe, Ebru Turanoglu Bekar, Johan Stahre, Anders Skoogh

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。

Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-08-25 cs.SE cs.CR 版本更新 57%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20360 2026-08-25 cs.AI 版本更新 57%

Evaluating Large Language Models for automatic analysis of teacher simulations

评估用于教师模拟自动分析的大型语言模型

David de-Fitero-Dominguez, Mariano Albaladejo-González, Antonio Garcia-Cabot, Eva Garcia-Lopez, Antonio Moreno-Cediel, Erin Barno, Justin Reich

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究评估了DeBERTaV3、Llama 3等LLMs在教师教育数字模拟响应特征识别中的性能,发现Llama 3检测新特征更稳定,可为相关自动评估研究提供指导。

Comments Final published version in the Heliyon journal. Volume 12, Issue 14, September 2026, e45323. DOI: this https URL (https://doi.org/10.1016/j.heliyon.2026.e45323)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23550 2026-08-25 cs.HC cs.CR 新提交 50%

When "Do Not" Is Not Deny: Security Rules in CLAUDE.md vs Built-In Controls

当“不要”并非“拒绝”:CLAUDE.md中的安全规则与内置控制

Ting Yan

专题命中 软件智能体 :agent(abstract)

AI总结 该研究对比CLAUDE.md的自然语言安全规则与Claude Code内置控制的匹配度,发现仅4%-16%的规则有匹配控制,揭示开发者无法获知规则是否被强制执行的安全问题。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22928 2026-08-25 cs.PL cs.CR 新提交 50%

When Can Agents Safely Checkpoint, Fork, Restore, and Merge? Exact Checking for Execution Edits

智能体何时能安全地进行检查点、分叉、恢复与合并?执行编辑的精确检查

Yusheng Zheng, Xiaoyu Song, Yanpeng Hu, Lebin Cheng, Yuxi Huang, Wei Zhang

专题命中 软件智能体 :agent(abstract)

AI总结 该研究针对智能体的检查点、分叉等执行编辑操作,提出一种精确判定编辑安全性的算法,通过形式化方法验证,相关成果已在 Lean 中实现并开源。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05518 2026-08-25 cs.DC 版本更新 50%

Latent Reasoning Guidance for Parallel Code Translation

并行代码翻译的潜在推理引导

Tomer Bitan, Erel Kaplan, Roee Bar-Yadin, Lian Ghrayeb, Le Chen, Samyak Jhaveri, Niranjan Hasabnis, Gal Oren

专题命中 软件智能体 :autonomous agent(abstract)

AI总结 提出一种在测试时使用过程奖励模型(PRM)对连续潜在前缀进行评分,以在最终代码解码前选择替代隐藏状态轨迹的方法,从而提升并行代码翻译的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02609 2026-08-25 econ.TH econ.EM 版本更新 50%

Revealed Social Networks

揭示的社会网络

Christopher P. Chambers, Yusufcan Masatlioglu, Christopher Turansick

专题命中 软件智能体 :agent(abstract)

AI总结 本文针对线性均值模型开发显示偏好式检验,研究其识别特性,发现结果变量维度与识别密切相关,一维时识别失效普遍,多维时识别普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏