Hallucination to Consensus: Multi-Agent LLMs for End-to-End JUnit Test Generation
幻觉到共识:多智能体LLM用于端到端JUnit测试生成
专题命中 软件智能体 :agent(title);multi-agent(title);分类 cs.SE
AI总结 本文提出CANDOR框架,通过多智能体协作生成Java单元测试,利用共识策略减少幻觉并提升Oracle准确性,实验表明其在代码覆盖率和突变得分上优于现有方法。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
幻觉到共识:多智能体LLM用于端到端JUnit测试生成
专题命中 软件智能体 :agent(title);multi-agent(title);分类 cs.SE
AI总结 本文提出CANDOR框架,通过多智能体协作生成Java单元测试,利用共识策略减少幻觉并提升Oracle准确性,实验表明其在代码覆盖率和突变得分上优于现有方法。
机构 * University of Minnesota - Twin Cities(明尼苏达大学-双城分校)
专题命中 软件智能体 :agent(title);multi-agent(title);分类 cs.AI
专题命中 软件智能体 :agent(title);AI agent(title);分类 cs.AI
从智能体行为到智能体友好型文档:关于编码智能体如何发现、阅读和编写技术文档的实证研究
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本研究通过SWE-chat和AIDev两个数据集,揭示编码智能体的文档交互规律,发现面向智能体的制品占主导,文档与代码编辑关联弱,验证序列缺失,文档滞后代码,且"智能体友好型"文档的可操作性、可验证性缺乏行为支持。
Comments 14 pages, 1 figure, 10 tables
基于智能体AI的仿真调度加速遗传编程超启发式算法
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出基于Claude智能体AI的系统性重构方法,用于解决Python项目调度仿真代码的运行瓶颈,使运行时间大幅缩短,年节省大量核心小时与成本。
面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准
专题命中 软件智能体 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。
Comments 9 pages
资源受限智能体大语言模型后训练的协同协同进化方法
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 针对资源受限智能体LLM后训练的高内存、长耗时问题,提出CoPES方法,在GPU小时预算下,其验证准确率恢复率、内存效率均优于标准ES和LoRA-GRPO,在多任务基准上表现更优。
Comments 14 pages,9 figures, submit to AAAI 2027
RefactorAssist:用于可靠代码重构的智能体式优化工具
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究针对LLM生成代码重构的错误问题,开发了RefactorAssist智能体,通过静态修复结合测试引导的智能体修复,将重构累计通过率提升至94.2%,提高了LLM重构代码的可靠性。
Comments 27 pages, 10 figures, submitting to ACM TOSEM
针对反例补充草图的智能合成
机构 * Independent(独立研究者)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对编码智能体修复失败示例易留隐患的问题,提出针对反例补充草图的智能合成方法,通过人类给出草图、智能体生成实现,依据反例修正并保留代码,经实验验证该方法能减少返工,承载审查策略。
Comments 32 pages, 5 displayed figures (4 distinct screenshots). Includes the CatSynth artifact supplement. Code and captured experiment artifacts: https://github.com/open-horizon-labs/counterexample-supplemented-sketches Clarifies the two-check CESS method and Developer change authority; adds the protocol-correct CatSynth rerun and replaces the prior withheld-case headline
代码即主体:用于递归演化与传承的智能体自有软件主体
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出OurArk架构,以智能体自有软件主体为核心实现个人智能体的受控自演化与递归传承,在开源工具中实现并经测试验证,为个人智能体提供了可管控演化的具体基础。
Comments 9 pages, 3 figures
智能体团队工作区:面向长期存在的编码智能体团队的自动化持久工作区
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究针对Claude Code等大语言模型智能体在长期工作流程中存在的问题,提出ATWZ,通过围绕其原生智能体团队构建基于文件系统的操作层,保存智能体工作状态等,解决相关问题并减少提示编写工作量。
Comments 31 pages, 9 figures
智能体检索基准:评估代码智能体的仓库上下文检索
专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究代码智能体仓库上下文检索问题,引入智能体检索基准,涵盖多种检索任务和样本。评估多种检索方法,发现无单一方法占优,存在校准差距,且记录轨迹有缺失。通过试验表明检索得出的初始上下文有优势,神谕金上下文还有提升空间。
DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台
机构 * Peking University(北京大学) ; Institute for Advanced Algorithms Research(先进算法研究所) ; Zhongguancun Academy(中关村学院)
专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。
Comments 13 pages, 2 figures, and 5 tables. Technical report
智能代码审查有用吗?挖掘开发者对CodeRabbit在实际应用中代码审查的反馈
机构 * The University of Melbourne(墨尔本大学) ; Monash University(莫纳什大学)
专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE
AI总结 以CodeRabbit为例对智能代码审查进行实证研究,通过大量代码审查与开发者反馈数据,揭示其审查结果及被拒原因,还探索预测审查被拒的方法,指出改进空间与不足。
智能AI辅助编码为软件开发过程中注入认知基础提供了独特契机
机构 * Center for Proteomics and Metabolomics, Leiden University Medical Center(蛋白质组学与代谢组学中心,莱顿大学医学中心) ; National Institute of Standards and Technology - Charleston(国家标准与技术研究院-查尔斯顿)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 研究以蛋白质组学为例,提出社区管理的领域范围认知基础文档用于智能AI辅助编码。核心方法是文档编码硬约束和约定参数。主要贡献是助力非领域专家生成优质代码等,增强各方信心并让领域专家参与定制软件开发。
Comments Letter, 12 pages, 1 table
TRIM:通过代理轨迹最小化减少人工智能生成的代码冗余
机构 * Dept. of Computer Science Columbia University(计算机科学系哥伦比亚大学) ; Google Inc(谷歌公司) ; Google DeepMind(谷歌DeepMind)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究人工智能生成代码冗余问题,提出TRIM算法,通过最小化代理轨迹间接减少代码冗余,实验证明该方法有效且高效,能显著降低代码冗余,同时减少验证成本。
检索就足够了:使用工具的智能体实现无需训练的可解释性
机构 * University of Maryland(马里兰大学)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究神经网络激活可解释性方法,提出HARP方法,即让语言模型智能体利用激活向量数据库及工具,通过迭代查询、形成并验证假设来实现无需训练的可解释性,该方法在多方面表现出色,还凸显现有训练方法局限并推动新基准测试。
Comments 25 pages, 7 figures
作为认知失败的压缩:智能语言模型工具如何从终止进程中编造确认结果
机构 * Independent Researcher(独立研究者)
专题命中 软件智能体 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究智能语言模型编码工具中Claude Code的失败模式,即超时命令部分输出被误记为确认结果并传播误报,揭示其观察与持久性 conflation 的机制,指出对依赖会话连续性的工作流程有影响。
Comments 8 pages, companion to arXiv:2606.26185
记住你的踪迹:一种基于记忆的长周期代理框架,用于一致且分层的仓库级代码文档
机构 * Sungkyunkwan University(成均馆大学) ; University of Oslo(奥斯陆大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.SE
AI总结 MemDocAgent通过依赖感知遍历引导和记忆引导代理交互,生成统一上下文的仓库级代码文档,实现高效且一致的文档生成。
超越攻击成功率:工具使用型人工智能代理的行动分级严重程度量表
专题命中 软件智能体 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究指出代理红队测试基准的二元攻击成功率不能体现行动危害。为此引入行动分级伤害准则,通过预言机和评判小组计算量表。在AgentDojo工作区测试发现该准则能揭示新情况,虽与预言机一致性高但有盲点,贡献了可用于红队日志实际行动的严重程度工具。
Comments 8 pages, 6 figures. Code and artifacts: https://github.com/Harry-Ashley/action-graded-severity
SkillFab:一个原生代理技能生产平台
机构 * Peking University(北京大学) ; Huawei(华为) ; Northwestern Polytechnical University(西北工业大学) ; Zhongguancun Academy(中关村学院)
专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 SkillFab是原生代理平台,将缺失能力转化为可复用技能。运行时代理先找技能,无则提需求,经SkillFab管理库等流程开发,通过多界面暴露相同生命周期,使工作可审查可恢复,还介绍了平台及案例。
Comments 12 pages, 7 figures. Technical report
廉价代码,昂贵判断:可控代理软件工程案例研究
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 通过12周案例研究,提出治理转换理论模型,解释专家工程师如何利用AI编码代理实现高速开发并保持可控性。
Comments 13 pages
TraceLab: 表征用于LLM服务的编码代理工作负载
机构 * University of Washington(华盛顿大学) ; Wuhan University of Technology(武汉理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 通过收集4300个编码代理会话(含35万LLM步骤和43万工具调用)的真实轨迹,分析发现长自主循环、长上下文短输出、多样化重尾工具调用及高但不完美前缀缓存命中率等特征,为优化服务提供具体方向。
AI代理中的证明-护栏以及从其中(不)应信任什么
专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出proof-of-guardrail系统,通过可信执行环境生成加密证明,确保代理在特定开源护栏后生成响应,同时保护开发者隐私,但指出恶意开发者可能欺骗安全措施的风险。
Comments AI4GOOD Workshop at ICML'26. Code: https://github.com/SaharaLabsAI/Verifiable-ClawGuard
SIGA: 用于科学模拟的自演化编码智能体适配器
机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 软件智能体 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 提出SIGA适配器,通过检索、程序记忆、轨迹内验证和验证强制终止,将通用编码智能体转化为科学模拟软件操作员,在GEOS上实现36倍加速,并支持自演化提升性能。
代理软件工程:基础支柱与研究路线图
机构 * Queen's University(女王大学) ; Concordia University(Concordia大学) ; Nara Institute of Science and Technology(奈ara科学和技术研究院) ; Huawei Canada(华为加拿大)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 提出代理软件工程(SE 3.0)时代,以“面向人类的SE”和“面向代理的SE”双重模式为基础,重新定义软件工程支柱,并设计代理命令环境(ACE)和代理执行环境(AEE)两种工作台,实现双向人机协作,推动从代理编码到真正代理软件工程的演进。
RAVEN:用于自动化漏洞修复的智能体检索增强生成框架
机构 * University of Duisburg-Essen(杜伊斯堡- Essen大学)
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.LG、cs.SE
AI总结 提出RAVEN框架,集成智能体RAG管道与可控迭代修复,利用开源LLM实现跨类型、跨语言的自动化漏洞修复,在160个真实CVE上达到83.13%修复成功率。
Comments 17 Pages, 4 figures. Under review
基于上下文学习的深度学习工作负载迁移智能体框架
机构 * Google(谷歌)
专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。
无意外软件智能体:首个用于人类代码熵降低的正则代码,以及30到500倍的前沿模型需求降低
专题命中 软件智能体 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 提出智能体优先的正则代码方法,通过行为等价商化人类代码中的意外熵,实现30-500倍的前沿模型需求降低,核心是行为等价商化和证明携带变更。
Comments 36 pages
通过发起野生的代码理解之旅来投射SWE代理新兴思维模式
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中 软件智能体 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.SE
AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。