TDD-Agent: Test-Driven Reasoning for Code Generation
TDD-Agent:用于代码生成的测试驱动推理
专题命中 软件智能体 :agent(title,title_cn);分类 cs.AI、cs.SE
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
TDD-Agent:用于代码生成的测试驱动推理
专题命中 软件智能体 :agent(title,title_cn);分类 cs.AI、cs.SE
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
通过智能体轨迹剖析模型行为
机构 * AWS AI Labs(AWS人工智能实验室)
专题命中 软件智能体 :agent(title,summary_cn);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出“意图-执行差距”概念,并设计Simple Strands Agent(SSA)框架,通过分析138k条轨迹揭示模型在自主问题解决中的行为差异。
Comments 106 pages, 50 Figures, 16 Tables
当错误成为叙事:生产级LLM Agent运行时中静默故障的纵向分类
机构 * Independent researcher(独立研究者)
专题命中 软件智能体 :agent(title,title_cn);分类 cs.AI、cs.SE
AI总结 通过八周对生产级个人助手Agent运行时的研究,识别出28次静默故障,提出五类机制导向分类,其中D类(链式幻觉与捏造)为LLM特有且最危险,系统会生成流畅可信的虚假叙事。
Comments 18 pages, 5 figures, 2 tables. 22 incident postmortems and all defense-framework artifacts publicly available at https://github.com/bisdom-cell/openclaw-model-bridge; governance engine on PyPI (openclaw-ontology-engine)
从解剖到气味:Agent技能中SKILL.md的实证研究
专题命中 软件智能体 :agent(title,title_cn);分类 cs.SE
AI总结 对238个真实Agent技能的SKILL.md文件进行定性分析,构建语义组件分类法,通过多源文献综述识别最佳实践并定义技能气味,开发自动检测器发现超过99%的文件存在气味且难以消除。
责任归属:在智能体软件开发中将人类责任映射到工作流制品
专题命中 软件智能体 :workflow(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 该研究分析智能体软件开发中责任归属的矛盾,替换验证分类法,发现责任归属方向相反,指出智能体工具未造成责任差距,相关数据已公开。
Comments 30 pages, 5 tables. Source collection of 118 archived documents and 12 processing scripts deposited at Zenodo, doi:10.5281/zenodo.21965182
智能体编码时代人机协作的工程信号:对vLLM和SGLang中33228个拉取请求的纵向分析及其对生物医学智能体和生物信息学流程开发的启示
专题命中 软件智能体 :agentic(title,abstract);AI agent(title);autonomous agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该研究对vLLM和SGLang的33228个拉取请求进行纵向分析,发现AI辅助开发提升了开源软件的吞吐量、贡献者参与度及人机协作信号,且增长主要由人类驱动,为生物医学智能体开发提供启示。
Comments 24 pages, 9 Figures
迈向工业中人工智能代理创建民主化的持续保障
专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 针对工业中人工智能代理创建民主化带来的可靠性挑战,提出轻量级持续保障框架,结合依赖映射等多种方法评估代理运行状态,还展示了原型审核器及评估,为公民创建的组织代理提供保障。
GitHub上的AI代理拉取请求:频率、结构和合并冲突率
专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.SE
AI总结 利用AIDev-pop数据集对AI代理编写的拉取请求并发情况进行大规模实证分析,发现特定时间重叠下部分仓库有协同活动的请求对,多数为同一代理,还研究了合并冲突率及冲突类型。
Comments 7 pages, 4 figures, 2 tables. Replication package: https://doi.org/10.5281/zenodo.21186464
智能体数据注入攻击对人工智能智能体构成现实威胁
机构 * Seoul National University(首尔国立大学) ; Largosoft ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI
AI总结 介绍智能体数据注入攻击(ADI)这一新型间接提示注入,其伪装可信数据注入恶意数据使智能体执行意外操作,研究发现现实智能体漏洞及ADI在多种模型和智能体设置中有效,揭示智能体安全关键差距。
Comments 19 pages, 19 figures, 7 tables
从注册表到仓库:AI代理技能如何编写、适配和维护
专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.SE
AI总结 本研究首次对AI代理技能作为工程制品进行实证分析,通过挖掘公共注册表和GitHub仓库中的技能,发现技能重用多为一次性复制,定制化主要适配本地环境,而行为契约几乎不变。
基于知识的拉取请求:一种可信的智能体中介知识协作工作流
专题命中 软件智能体 :agent(title,abstract);workflow(title,abstract);分类 cs.SE
AI总结 提出知识型拉取请求(KPR)工作流,通过分离知识采纳与实现合并,利用智能体蒸馏外部知识并再生代码,以降低跨信任边界的软件协作成本。
Agentic Very Much! 新GitHub项目中编码助手的采用
专题命中 软件智能体 :agentic(title,title_cn);agent(title);分类 cs.SE
AI总结 研究新创建的GitHub项目中编码助手的采用情况,发现采用率是之前研究的两倍以上,且AI辅助提交比例显著更高。
Harness手册:使不断演进的智能体框架具有可读性、可导航性和可编辑性
机构 * Tencent(腾讯) ; Indiana University(印第安纳大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; University of Georgia(佐治亚大学) ; National University of Singapore(新加坡国立大学)
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);planning(abstract);agentic(abstract)
AI总结 研究智能体框架演进中行为定位难的问题,提出通过Harness手册和行为引导的渐进式披露,以行为为中心自动合成框架表示并辅助规划,提高行为定位和编辑计划质量,助力复杂智能体系统发展。
Comments 29 pages, 6 figures. Project page: https://ruhan-wang.github.io/Harness-Handbook/
TraceView: 智能体程序修复轨迹的交互式可视化
机构 * Belmont University(贝尔蒙特大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)
AI总结 提出TraceView工具,通过交互式可视化和语义关系标注,帮助开发者诊断LLM-based自动程序修复代理的失败原因,支持轨迹扫描与理解。
超越辛普森悖论:AI 智能体拉取请求合著中的级联混杂因素
机构 * Independent Researcher(独立研究者) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.SE;agentic(comments)
AI总结 本研究通过分层分析和多级控制,揭示了AI编码智能体拉取请求合著与合并率之间的关联主要由智能体组成、仓库选择和PR结构等混杂因素驱动,而非因果关系。
Comments 5 pages. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)
角色专业化模型(RSM):在智能体软件开发中协调基于大语言模型(LLM)的工具——一项探索性案例研究
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);workflow(abstract)
AI总结 本研究通过探索性案例研究提出角色专业化模型(RSM),协调Antigravity、Gemini CLI等三种LLM工具开发Python气候可视化应用,发现明确角色协调可优化开发质量但需配套策略与人工验证。
Comments 28 pages, 4 figures, 5 tables
AutoPDE: 通过显式表示的求解器策略实现可靠的智能体PDE求解
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Eastern Institute of Technology, Ningbo(宁波东方理工大学)
专题命中 软件智能体 :agent(summary_cn,abstract);agentic(title);分类 cs.AI
AI总结 提出AutoPDE,一种将求解器策略作为显式对象维护的代码智能体,通过PDE分析、数值方法选择和自适应调优三阶段构建策略,在PDE Agent Bench上达到54.5%的通过率,比最强基线提升14.2个百分点。
量化智能体剖析:代码合成智能体工作负载中的VRAM稳定性与预测
机构 * Nokia Germany(诺基亚德国)
专题命中 软件智能体 :agent(title,abstract);agentic(title);分类 cs.AI、cs.LG
AI总结 该研究针对基于LangGraph的AgentK智能体,在1920条轨迹上评估量化LLM的VRAM消耗,提出闭式峰值内存预测模型,发现编译成功率受LLM容量限制,且无需复杂VRAM预测模型。
在拉取请求之前:挖掘多智能体协调
机构 * Arizona State University(亚利桑那州立大学)
专题命中 软件智能体 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.SE
AI总结 针对自主编码智能体在拉取请求中协调不足的问题,提出基于git的协调基板grite,通过事件日志减少重复和冲突工作,提升吞吐量,并自动恢复多种故障模式。
Comments 9 pages, 2 tables. LNCS format. Code, dataset, and mining toolkit: https://github.com/neul-labs/grite
门前的习惯化:人类对AI智能体代码审查中批准率上升与审查力度下降
专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.SE;agentic(comments)
AI总结 通过分析400名重复审查者在七个月内对AI生成代码的审查行为,发现批准率从30.1%上升至36.8%,审查评论量下降22%,而等待时间增加3.5倍,表明审查者因工作负荷增加而出现习惯化反应。
Comments 5 pages, 2 figures, 2 tables. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)
内化身份基元:公有区块链上自主智能体的密码学个体性
专题命中 软件智能体 :agent(title,abstract);autonomous agent(title);分类 cs.AI
AI总结 本文提出将公有区块链上自主智能体的身份密钥-权重绑定信任根转移至密码学假设,在Solana开发网部署了首个身份基元为密码学不变量的链上智能体,完成了2.36天链上运行,实例化了密码学个体性。
Comments 52 pages, 3 figures, 11 tables. Cryptographic key-to-weights binding (W = HKDF(sk) inside Groth16) with an on-chain state-commitment chain on Solana devnet; active-query, homeostatic, and economic-metabolism extensions; 166- and 168-cycle continuous runs. Code, threat model, and per-cycle telemetry: https://github.com/ksk-S/internalising-identity-2026 (tag arxiv-v1)
为软件修复代理编写错误报告:哪些信息最重要?
专题命中 软件智能体 :agent(summary_cn,abstract);AI agent(abstract);agentic(abstract);分类 cs.SE
AI总结 研究软件开发中为软件修复代理编写错误报告的问题,通过对错误报告分类标注,用三个LLM主干运行mini-swe-agent,拟合回归模型,发现定位线索和建议修复等信息对代理成功更重要,传统对人类有用的信息作用较小。
什么是适合人工智能代理的优质错误报告?
专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.SE
AI总结 研究自动化程序修复代理的优质错误报告,通过统计建模和受控消融分析发现,代理受益于具体可执行且定位好的信息,与人类优质报告有别,如自然语言重现步骤等对代理作用不大,不同模型处理缺失信息方式有差异。
对抗评审:基于结构化分歧的 grounded 智能体代码评审
机构 * Cornell University(康奈尔大学) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出对抗评审(AR)协议,仅用3个智能体实现结构化分歧的协作代码评审,在LiveCodeBench、SWE-PRBench等基准上优于多智能体基线,证明无需大量智能体即可完成高效代码评审。
Comments Accepted to ICML 2026 Workshop on DL4C
面向仓库级代码问答的深度智能体搜索:一项实证研究
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 该研究在SWE-QA基准上对比语义搜索与深度智能体搜索的代码问答效果,发现语义搜索正确率更高、成本更低,深度智能体搜索存在交接环节的新失败问题。
Comments 41 pages, 21 figures, 6 tables. Under review at a journal
野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析
机构 * Microsoft Azure Research(微软Azure研究院) ; Microsoft Azure(微软Azure)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。
AgenticRepair:面向智能体漏洞修复的多维度程序上下文工程
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 针对现有智能体漏洞修复方法缺乏多维度程序上下文工程的问题,提出AgenticRepair框架,协调三个LLM子智能体构建三类上下文,在SEC-Bench上取得73%的修复成功率,显著优于基线。
Comments Under Review at IEEE TSE
Code-Augur:通过规约推断的智能体漏洞检测
机构 * National University of Singapore(新加坡国立大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 提出安全规约优先范式,通过显式化智能体假设并运行时反证,结合引导式模糊测试提升漏洞检测能力,在真实项目中比现有智能体检测更多漏洞。
面向指令即代码:理解指令文件对智能体拉取请求的影响
机构 * École de Technologie Supérieure
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 通过分析148个项目的15549个智能体PR,发现指令文件对合并率、代码变更量和合并工作量无一致正面影响,但成功项目指令文件更长且结构更清晰,提出“指令即代码”研究方向。
Comments 5 pages, 8 figures, 23rd International Conference on Mining Software Repositories, April 13--14, 2026
什么使一个工具成为工具:智能体工具的必要和充分条件
机构 * Federal Institute of Goiás(戈亚斯联邦理工学院)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文通过概念分析,定义了智能体工具的必要和充分条件,并提供了包含/排除测试,以区分智能体工具与智能体框架、SDK、IDE插件等。