arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-28 至 2026-08-28 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 12 篇

2608.26218 2026-08-28 cs.AI cs.SE 新提交 81%

Same Model, Different Harness: Different Coding-Agent Results

相同模型,不同工具链:编码智能体的结果差异

Sydney Lewis

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文探究模型与任务固定时,工具链改变对编码智能体结果的影响,发现特定工具链配置可提升模型在编码基准的表现,故编码智能体评估需将模型与工具链共同视为求解器。

Comments 24 pages, 9 figures. Software and study artifacts: this https URL (https://github.com/sydches/yuj)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26742 2026-08-28 cs.NI cs.SE 新提交 77%

Claude Code Complete User Handbook

Claude Code 完整用户手册

David Soldani

专题命中 软件智能体 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本书针对智能体工作环境Claude Code,提出四项治理主张,详述安全高效操作该系统的方法,附原始来源引用、证据账本及相关框架对照表与成熟度模型。

Comments 208 pages, 34 chapters, 14 appendices, 7 figures, 46 tables, 106 references, 13 worked exercises. Version 1.0. Verification baseline: Claude Code 2.1.241, 23 August 2026; re-verified against 2.1.246, 26 August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26557 2026-08-28 cs.SE 新提交 77%

DeepRepro: State-Aware Subplanning for Paper-to-Code Reproduction in Evolving Repositories

DeepRepro:面向演化仓库中论文到代码复现的状态感知子规划

Hongru Song, Ruqing Zhang, Jiafeng Guo, Xueqi Cheng, Maarten de Rijke

专题命中 软件智能体 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.SE

AI总结 针对现有论文到代码复现系统因静态规划易出现不一致的问题,提出DeepRepro状态感知框架,通过动态生成子规划并结合编排与监控,在PaperBench Code-Dev上表现优于基线

Comments Accepted by CIKM2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-28 cs.SE 版本更新 77%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-08-28 cs.SE cs.AI 版本更新 73%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26753 2026-08-28 cs.SE cs.AI 新提交 62%

Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research

超越执行:审计大语言模型驱动科学研究中的实验保真度

Lezhi Yu, Xiaogang Xu, Yuhua Zhou, Shuibing He, Aimin Pan

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对LLM驱动科学实验中智能体的方法学幻觉问题,提出ABE-Ralph审计框架,在复现实验中实现93%稳健执行率,可检测科学失败模式,NatureBench任务表现优异。

Comments 20pages, 5 figures, code link: this https URL (https://github.com/Flavorfish/AutoRepro)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27021 2026-08-28 cs.NI cs.AI 新提交 57%

FaulT-Bench: Towards Benchmarking Network Troubleshooting LLM Agents under Unreliable User Tickets

FaulT-Bench:面向不可靠用户工单场景下网络故障诊断大语言模型智能体的基准测试

Kuan-Hao Tseng, Niruth Bogahawatta, Yasod Ginige, Kunjan Patel, Kosta Dakic, Suranga Seneviratne

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 FaulT-Bench 是针对网络故障诊断 LLM 智能体的基准测试,涵盖含虚假工单的 200 个场景,评估 SADE 等智能体后发现其在错误工单上性能骤降,可用于开发可靠的智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26130 2026-08-28 cs.CL cs.IR 新提交 57%

Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses

智能体不进行分页:面向大语言模型工具响应的首块选择

Tatiana Petrova, Andrei Mazniak, Radu State

机构 * SnT, University of Luxembourg(卢森堡大学SnT(卢森堡大学安全、可靠性与信任中心))

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究针对LLM编码智能体的工具响应首块选择问题,发现提升首块Top1准确率不会系统性提升下游准确率,无参数关键词评分器可提升p₁但不影响下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07440 2026-08-28 cs.AI 版本更新 57%

Blast Radius

爆炸半径

MY Pitsane, Hope Mogale

机构 * Algorithm Reconnaissance Division(算法侦察部) Mankind Research Labs(人类研究实验室) North-West University(西北大学) University of Pretoria(比勒陀利亚大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 针对智能体编码的令牌浪费问题,提出Blast Radius内存管理层,结合NECROPHORESIS与RDM实现可逆上下文驱逐,在7个OpenAI模型上降低令牌消耗17%-26%,提升编码可持续性。

Comments major revisions are needed and this will be restored later on

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-08-28 cs.AI 版本更新 57%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23749 2026-08-28 cs.SE 版本更新 57%

A Survey of LLM-based Automated Program Repair: Taxonomies, Design Paradigms, and Applications

基于大型语言模型的自动程序修复综述:分类、设计范式与应用

Boyang Yang, Zijian Cai, Fengling Liu, Bach Le, Lingming Zhang, Tegawendé F. Bissyandé, Yang Liu, Haoye Tian

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文综述了基于LLM的自动程序修复,提出统一分类法,涵盖四种范式,并讨论了评估实践和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02475 2026-08-28 cs.SE 版本更新 57%

Lost in Code Generation: Reimagining the Role of Software Models in AI-driven Software Engineering

在代码生成中迷失:重新构想软件模型在AI驱动软件工程中的作用

Jürgen Cito, Dominik Bork

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 该研究针对AI生成软件存在的缺陷,提出从AI生成系统中恢复软件模型,区分智能体与人类反思循环,将软件模型作为连接现有软件工程与AI驱动开发的桥梁,拓展了软件模型的作用。

Comments New version accepted at MODELS'26

详情

展开后加载摘要…

URL PDF HTML 收藏