OrcaLoca: An LLM Agent Framework for Software Issue Localization
机构 * University of California, San Diego, USA(加州大学圣迭戈分校) ; Intel Corporation(英特尔公司)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
机构 * University of California, San Diego, USA(加州大学圣迭戈分校) ; Intel Corporation(英特尔公司)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
TRUSS:面向任务可靠且用户安全的自动化智能体技能生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。
基础智能体与智能型深度研究结合:基于证据的临床代码预测
专题命中 软件智能体 :agentic(title);workflow(abstract);分类 cs.AI、cs.CL
AI总结 本文提出ICD-Deepresearch工作流,结合EHR基础模型、语言基础模型与医学搜索工具,在MIMIC-III、MIMIC-IV数据集上实现ICD编码预测,其检索证据的医生有用性评分优于对比系统。
评估分布式系统中智能体的代码修复能力
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。
Comments Under submission
采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。
Comments 14 pages, 4 figures, 3 tables. v2: added plain-text log URLs in Section 10 for LLM readability
用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。
AI编码智能体研究中缺失了人类
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
更好、更快、更强:程序化技能学习最能降低智能体成本
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。
Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。
SkillClaw: 让技能与代理进化者共同进化
机构 * DreamX Team(DreamX团队)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。
ADIAS:交互式智能体系统的自动化设计
机构 * University of Cambridge(剑桥大学) ; Tencent(腾讯)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对现有智能体设计方法的缺陷,提出以问题为中心的优化方案,构建ADIAS框架,在五个交互式基准中较最强基线平均提升25.2%,消融实验验证了关键机制的有效性。
Comments 23 pages, 7 tables, 5 figures
SkillTrace:面向LLM智能体技能复用的多溯源审计
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SKILLTRACE框架,通过提取三种溯源审计LLM智能体技能复用,在SKILLTRACE-BENCH上取得高指标,野外审计显示其能生成更具操作性的复用审查队列。
CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。
EDATracer:用于大规模EDA工件分析的智能体框架
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出EDATracer框架,将EDA工件组织为知识图谱搭配语义向量索引,构建含2787个开源芯片设计的18.9GB数据集及90题基准,使LLM智能体跨工件检索证据,准确率优于Cursor、Claude Code且token用量更少。
代理AI技能的正式分析与供应链安全
机构 * Independent Research(独立研究)
专题命中 软件智能体 :agentic(title);agent(abstract_cn);分类 cs.AI、cs.SE
AI总结 SkillFortify是首个用于代理技能供应链的形式化分析框架,通过六大贡献提升安全性和检测效率。
Comments 32 pages, 5 theorems with full proofs, 68 references, open-source tool: https://github.com/qualixar/skillfortify
LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE
AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。
Comments Project page: https://loopsbench.ai/
μ子何时有助于智能体强化学习?
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 研究μ子在稀疏奖励智能体强化学习中的作用,通过与AdamW对比,发现在组内组策略优化下,μ子应用于隐藏权重矩阵能提升成功率,效果与优势估计器、学习率有关,表明其可使智能体RL受益,还需多种子和跨任务验证。
用于遗留代码迁移确定性验证的智能体方法
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出名为Locksmith Loop的智能体测试合成方法,通过在三项COBOL-Java案例研究中提升测试覆盖率,实现了遗留代码迁移的确定性验证。
Comments 11 pages, 6 figures
上下文文件对编码智能体有帮助吗?针对真实仓库的双智能体消融研究
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本研究通过双智能体(Claude Code、Codex)的受控消融实验,发现上下文文件对编码智能体的正确性无显著提升,其失败源于实现技能而非知识缺失,还解释了过往研究矛盾的原因并公开了相关资源。
SpecFirst:将行为规范提取作为从零开始的基于智能体的程序合成中的一等步骤
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE
AI总结 SpecFirst是将行为规范提取设为独立前置阶段的两阶段框架,在ProgramBench上显著提升了从零开始的程序合成的测试通过率与二进制探索覆盖率。
编写智能体技能:一种软件工程方法
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 研究如何编写智能体技能,遵循软件工程原则,以Claude Code为参考实现阐述技能结构等,与其他塑造智能体行为机制比较并给出选择规则,还介绍评估驱动编写过程等,为智能体技能编写提供方法。
用于Tokenmaxxing的最佳编程语言:跨编程语言的编码代理行为研究
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE
AI总结 研究跨Python、Java、Rust和OCaml的编码代理行为,通过评估五个模型发现不同语言的令牌消耗有显著差异。分析代理轨迹结构与内容,揭示其在不熟悉语言中的行为特点,指出按语言的令牌效率对多语言代理基准测试和开发有指导意义。
人工智能编码代理如何为软件开发做出贡献?对代理拉取请求的实证研究
机构 * Polytechnique Montréal(蒙特利尔大学)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.LG、cs.SE
AI总结 研究人工智能编码代理对软件开发的贡献,通过AIDev数据集,分析代理与人工生成PR的合并率差异、任务分布及关键特征,从实证和纵向角度理解其在软件开发中的作用、优点及局限性。
无需云端的智能编码:在纵向数据准备任务中评估开放权重的大语言模型
专题命中 软件智能体 :agentic(title);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 研究在纵向数据准备任务中评估开放权重的大语言模型,介绍开源框架,含真实数据集、任务定义和评估程序,通过基准测试发现当前先进模型表现良好,为治理受限研究中的AI辅助数据准备提供可行路径。
Comments Presented at SLLS 2026; accepted at CLS 2026 and RSS 2026
Locus:面向定向模糊测试的代理谓词合成
机构 * University of Chicago(芝加哥大学) ; University of Maryland(马里兰大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Northwestern University(西北大学)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 Locus通过合成语义谓词提升定向模糊测试效率,发现多个未修补漏洞。
Journal ref ICSE '26: 2026 IEEE/ACM 48th International Conference on Software Engineering
RESOURCE2SKILL: 从人类创建的多模态资源中提取可执行智能体技能
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Shanghai Jiao Tong University(上海交通大学) ; Microsoft(微软)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 提出RESOURCE2SKILL框架,从教程视频、代码库、文章等人类多模态资源中提取可执行技能,构建分层多模态技能维基,提升智能体在七个领域的任务表现。
证明或停止:不要信任代理,信任证据——用于可验证证据门控生命周期控制的循环工程
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 研究自主编码代理多步骤软件工作中生命周期状态缺乏证据支持的问题,提出证明或停止生命周期控制方法,经实验评估,该方法能有效控制生命周期转换,支持其作为与模型无关、主机中立的控制层。
Comments 48 pages, 10 figures, 29 numbered tables. Preprint v1
结构化反馈改进大语言模型智能体循环中的修复
机构 * Independent Researcher(独立研究者)
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 研究大语言模型智能体验证与调用接口问题,提出VeriHarness代码控制智能体循环。通过比较原始诊断与含失败位置等信息的反馈,发现含三个字段反馈能大幅提升成功率,多数增益源于可接受替代方案,JSON语法本身对修复无显著作用。
从成功流中追溯智能体失败
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 研究基于大语言模型的智能体系统失败归因问题,提出OAT方法将其转化为单类学习,用神经控制微分方程建模成功轨迹动态模式,实验表明该方法比基线快且F1分数更高,是诊断智能体系统失败的有效方向。
通过代码属性图和时间执行图进行多视角智能程序修复
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。
Comments 12 pages, 5 figures, 10 tables