Beyond Accuracy: Behavioral Dynamics of Agentic Multi-Hunk Repair
超越准确率:智能体多块修复的行为动力学
专题命中 软件智能体 :agentic(title);分类 cs.SE
AI总结 研究LLM驱动的编码智能体在多块缺陷修复中的行为,通过404个多块bug的1616条修复轨迹分析定位、修复准确率、回归行为及操作动力学,发现修复准确率随bug分散度和复杂度下降,且失败修复消耗更多资源。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
超越准确率:智能体多块修复的行为动力学
专题命中 软件智能体 :agentic(title);分类 cs.SE
AI总结 研究LLM驱动的编码智能体在多块缺陷修复中的行为,通过404个多块bug的1616条修复轨迹分析定位、修复准确率、回归行为及操作动力学,发现修复准确率随bug分散度和复杂度下降,且失败修复消耗更多资源。
持久递归世界支持自主软件演化
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出 Genesis 框架,以持久递归世界替代持久智能体,成功构建 C 编译器、重实现 MESA 模块,实现长周期软件开发并获显著性能提升。
基于熵的代码对抗翻译用于真实仓库迁移
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 针对LLM迁移仓库难达可运行状态的问题,提出多智能体框架ECAT,引入A2H-RepoBench基准,迁移质量达74.7%且优于现有方法。
图形代理:用于科学代理的结构化执行图
机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。
PAIChecker:揭示与检查类SWE-Bench基准中的PR-Issue不匹配问题
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本研究针对类SWE-Bench基准中13.6%的PR-Issue不匹配问题,提出多智能体系统PAIChecker,经实验验证其在两类基准上的二元准确率最高达92.12%
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Github Repo: https://github.com/manyiResearch/PAIChecker
Skillware:用于持久行为工件的软件本体与工程生命周期
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对智能体技能成为持久行为工件却缺乏相关软件本体的问题,引入Skillware,通过Skill Artifact和Skillware Unit管理工件,阐述相关条件与证据,为智能体能力提供可识别、可组合、可维护及可演化的软件本体与工程生命周期。
Comments 26 pages, 6 figures, 5 tables
评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Independent Researcher, China(独立研究者,中国) ; Singapore Management University, Singapore(新加坡管理大学)
专题命中 软件智能体 :autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。
Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench
OPINE-World:基于本体错误优先的交互式探索的程序化世界建模
机构 * University of Toronto(多伦多大学)
专题命中 软件智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 提出OPINE-World,一种在线交互学习面向对象的程序化世界模型的LLM智能体,通过本体错误度量引导探索,在ARC-AGI-3基准上无需逐游戏训练即解决20/25个游戏,动作效率达78.4。
通过对抗攻击和训练实现鲁棒深度强化学习:综述
机构 * Institut de Recherche Technologique SystemX(技术研究 institute SystemX)
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 本文综述了深度强化学习中的对抗攻击与训练方法,系统分类并比较其目标与机制,以提升模型对环境变化和扰动的鲁棒性。
Comments 83 pages, 17 figues, 3 table, 15 algorithms
抗挫写入:一种六层耐用写入表面用于大语言模型编码代理
机构 * Sperixlabs, Ghana(塞普里克斯实验室,加纳) ; Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(库马西技术大学,加纳) ; VIA Cybersecurity Lab, Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(VIA网络安全实验室,库马西技术大学,加纳)
专题命中 软件智能体 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 本文提出Resilient Write,通过六层耐用写入表面提升编码代理在文件写入时的容错能力,减少恢复时间并提高自我纠正率。
调试调试器:面向软件工程智能体的失败锚定结构化恢复
机构 * Nankai University(南开大学) ; Tsinghua University(清华大学) ; Microsoft(微软)
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 提出PROBE框架,通过遥测层、诊断层和指导门将运行时证据转化为结构化恢复指导,在代码修复、工作流恢复等场景中诊断准确率65.37%,恢复率21.79%。
F(AI)2R:谁做了什么,谁进行了检查?可验证的人工智能溯源作为一项可执行技能
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究将F(AI)2R实验的溯源模型扩展为aiprov,涵盖任何含人工智能工件。方法被打包为可执行技能,由人工智能代理操作,能解析操作员身份,把关图一致性并发布论文版本,以自身为例展示溯源记录。
Artisan: 自动化代理评估
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE
AI总结 Artisan通过自动化LLM代理生成重现脚本,提升软件工程研究结果的可重复性,生成44/60个有效脚本并发现20个新错误。
Comments Accepted at ASE 2026
评估LLM代理在自动化软件分析任务中的性能
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE
AI总结 本文通过AnalysisBench评估四种LLM架构在自动化软件分析任务中的表现,发现AnalysisAgent在手动验证的成功率高达94%,而现有代理存在阶段混用、错误定位差等问题,且整程序分析和符号执行是最具挑战性的任务。
MirrorCode: AI 仅凭行为就能重建整个程序
机构 * Epoch AI ; Metr Prime ; Intellect University ; University of Warwick(沃里克大学)
专题命中 软件智能体 :AI agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 提出 MirrorCode 基准,基于从零复现完整软件项目评估 AI 长周期编码能力,最强模型得分 56%,如复现 16000 行生物信息学工具。
Comments 34 pages, 13 figures, 9 tables. Code available at https://github.com/epoch-research/MirrorCode
VulWeaver: 修补断裂语义以实现基于事实的漏洞检测
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE
AI总结 VulWeaver通过整合确定性规则与LLM语义推理构建增强依赖图,提取完整漏洞上下文,利用元提示和专家指南提升LLM推理能力,实验显示其在PrimeVul4J数据集上F1得分达0.75,优于现有方法。
从论文到程序:AI辅助量子多体代码生成中的知识外化
机构 * Institute of Physics, Chinese Academy of Sciences, Beijing 100190, China(中国科学院物理研究所,北京100190,中国)
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 针对AI直接翻译论文为代码时因隐含约定导致失败的问题,提出知识外化方法,通过多阶段人机协作流程将隐式假设显式化,在DMRG和Pfaffian-MPS任务上验证了有效性。
Comments 20 pages, 4 figures. Substantially revised presentation, related-work context, reproducibility documentation, validation-gate wording, limitations, and generative-AI disclosure; numerical results unchanged
动态分析增强问题解决
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.SE
AI总结 本文提出DAIRA框架,通过动态分析提升代码缺陷修复效率,实现高准确率和低资源消耗。
HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Xi’an Jiaotong University(西安交通大学) ; Nanjing University(南京大学) ; ZTE Corporation(中兴通讯)
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。
博弈中的递归联合模拟
机构 * Foundations of Cooperative AI Lab (FOCAL), Computer Science Department(合作人工智能基础实验室(FOCAL),计算机科学系) ; Carnegie Mellon University(卡内基梅隆大学) ; AI Center(人工智能中心) ; Czech Technical University(捷克技术大学) ; Center for Theoretical Study(理论研究中心) ; Charles University(查理大学)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究AI智能体通过递归联合模拟实现合作,证明该过程等价于原博弈的无限重复版本,从而可直接应用民间定理等现有结论。
先澄清再绘制:面向鲁棒文本到CAD生成的主动式智能体
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.LG
AI总结 提出主动式智能体框架ProCAD,通过澄清代理在代码生成前解决用户提示中的歧义,再通过CAD编码代理生成可执行程序,显著提升鲁棒性,平均Chamfer距离降低79.9%。
Comments ICML 2026
Mechanist:作为科学仪器的AI,用于发现智能的机制
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Heriot-Watt University(赫瑞瓦特大学) ; Southern University of Science and Technology(南方科技大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Northeastern University(东北大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。
Comments Work in progress
HINT:面向大语言模型驱动的RTL生成的可执行硬件意图表示层
专题命中 软件智能体 :agent(abstract);workflow(abstract)
AI总结 本文提出HINT可执行硬件意图表示层,用于LLM驱动的RTL生成,在7个算子案例中全量生成合规可综合RTL,面积较人工实现及直接C2RTL结果显著降低,还验证了其在各类复杂设计中的有效性。
Aether.jl:一种用动态语言编写、具备人机交互开发框架的高性能三维磁流体与多流体尘埃代码
专题命中 软件智能体 :agent(abstract);workflow(abstract)
AI总结 Aether.jl是一款用Julia编写的高性能三维磁流体与多流体尘埃代码,采用交互式人机开发框架,单GPU性能优于C++代码,在Frontier超算4096个GCD上并行效率超93%,支持CPU、GPU运行,已公开。
Comments 25 pages, 16 figures
FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Duke University(杜克大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG、cs.SE
AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。
Comments CoLM 2026
检索、调度、反思:用于芯片QoR优化的LLM代理
专题命中 软件智能体 :agent(abstract);agentic(abstract)
AI总结 本文提出基于LLM的代理框架,通过与EDA工具交互实现芯片优化调度,利用检索增强生成和帕累托驱动反馈提升QoR,实验显示其在时序改进、能耗和面积上优于强化学习等黑盒方法。
CodeEvo:通过混合和迭代反馈以交互驱动方式合成以代码为中心的数据
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 为解决高质量指令-代码对获取难题,提出双智能体架构CodeEvo,审查器制定模式并结合混合验证协议,构建CodeEvo-100K数据集,实验表明基于此数据微调的模型在代码生成基准测试中表现出色。
Comments ACL 2026 (Oral)
CodexGraph:通过代码图数据库连接大型语言模型和代码库
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 研究旨在解决大型语言模型处理整个代码库的难题,提出通过将LLM代理与代码库图数据库接口集成的CodexGraph系统,利用图数据库特性实现精确上下文检索和代码导航,经多基准评估及实际应用开发,展现其在软件工程中的竞争力与潜力。
Comments work in progress
CEO-Bench:智能体能否玩转长期博弈?
机构 * Princeton University(普林斯顿大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出CEO-Bench,通过模拟500天运营初创公司的任务,评估语言模型智能体在长期、不确定、动态环境下的综合决策能力。
Bespoke-Card:为何调优而非生成?合成工作负载特定的基数估计器
专题命中 软件智能体 :agent(abstract);planning(abstract)
AI总结 提出Bespoke-Card系统,通过智能体驱动合成工作负载特定的基数估计器,利用结构化q-error反馈和课程学习等策略,在JOB上降低33%总运行时间和41%中位数q-error。
Comments Accepted for AIDB@VLDB'26 (Boston)