Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents
校准后再行动:在大语言模型代理中考虑成本的探索
机构 * New York University(纽约大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出Calibrate-Then-Act框架,使LLM代理在不确定环境下显式平衡成本与不确定性,从而更优地决策。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
校准后再行动:在大语言模型代理中考虑成本的探索
机构 * New York University(纽约大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出Calibrate-Then-Act框架,使LLM代理在不确定环境下显式平衡成本与不确定性,从而更优地决策。
通过多标准潜在推理进行编码代理的上下文剪枝
机构 * Clemson University(克莱姆森大学) ; Morgan Stanley(摩根大通) ; Arizona State University(亚利桑那州立大学) ; University of Arizona(亚利桑那大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出LaMR框架,通过分解代码相关性为语义证据和依赖支持两个维度,利用多任务CRF模型提升编码代理的上下文剪枝效果,实验表明其在多个基准测试中表现优异。
在强化学习中塑造稀疏奖励:一种半监督方法
机构 * Department of Mathematics, The University of Hong Kong (HKU)(香港大学数学系) ; Department of Data and Systems Engineering, HKU(香港大学数据与系统工程系) ; Musketeers Foundation Institute of Data Science, HKU(穆斯克特基金会数据科学研究所)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种半监督方法,通过利用非零奖励转移和数据增强学习轨迹空间表示,提升稀疏奖励下的奖励塑造效果,在Atari和机器人操控任务中优于监督方法。
AIHarness工程:一种用于基础模型软件代理的运行时基质
机构 * Hong Kong Baptist University(香港 Baptist大学) ; Beijin Normal University(北京师范大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出AIHarness工程,通过运行时基质提升软件代理的工程能力,定义了十一项核心职责,并提出四层 ladder 框架和基于追踪的评估协议,以验证模型-基质-环境系统生成可验证、可归因和可维护的变更。
Comments 16 pages
SmellBench:评估LLM代理在建筑代码异味修复上的表现
机构 * University of Craiova(克劳索瓦大学) ; NVIDIA(NVIDIA公司) ; University Politehnica of Bucharest(布加勒斯特理工大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE
AI总结 本文提出SmellBench框架,用于评估LLM代理在修复建筑代码异味方面的性能,通过专家验证发现最佳代理修复率为47.7%,但修复 aggressiveness 与代码库质量呈负相关。
关于智能体与软件工程的研究议程:来自里约A2SE研讨会的成果
机构 * University of Southern Denmark(丹麦南方大学) ; Software Engineering Research Center, IIIT Hyderabad(IIIT海得拉巴软件工程研究中心) ; Pontifical Catholic University of Rio de Janeiro(里约热内卢天主教大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文基于智能体AI的兴起,探讨其对软件工程的影响,提出六个主题领域及短期和长期研究方向,为软件工程社区提供协调努力的结构化基础。
Comments 6 pages, 1 table, A2SE meeting, https://sites.google.com/view/a2se2026/home
CrackMeBench:用于代理的二进制逆向工程
机构 * University College London(伦敦大学学院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 CrackMeBench旨在评估语言模型代理在教育类CrackMe逆向工程任务中的能力,通过确定性二进制验证问题,结合公开校准CrackMe和生成任务,测试代理在无网络LinuxDocker沙箱中的表现,提供可重复的测试平台。
通过可执行代码工作流基准测试实时问答
机构 * Li Auto Inc(利亚 Auto 公司) ; Minzu University of China(民族大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出RT-QA框架,通过可执行代码工作流实现动态评估,发现现有模型在实时适应性上存在显著不足,主要问题包括懒惰检索和时间混淆。
MURPHY:具有回顾性信用分配的反馈感知GRPO用于多轮代码生成
机构 * Massachusetts Institute of Technology(麻省理工学院) ; AWS AI(AWS人工智能)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 MURPHY通过构建反馈条件化的rollout树,实现多轮自修正代码生成,采用最大奖励和平均奖励策略,并引入post-rollout剪枝机制,提升多轮优化效率。
Comments 21 pages, 2 figures, 8 Tables
利用LLM自动化能源感知的并行科学代码重构
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文研究LLM能否在经验执行反馈指导下生成能源高效的并行科学代码,提出LASSI-EE框架,通过多阶段迭代方法结合运行时功耗分析、能源感知提示、自纠正反馈循环和LLM作为裁判代理,实现代码重构。
Comments 12 pages, 5 figures, version under review at a peer-reviewed conference
SWE Atlas:超越问题解决的编码代理基准测试
专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE
AI总结 SWE Atlas通过涵盖代码库问答、测试编写和重构三个软件工程流程,提供了一种新的基准测试套件,评估编码代理的正确性和工程质量。
Comments 10 pages
PerfCoder:用于可解释代码性能优化的大型语言模型
机构 * University of Alberta(阿尔伯塔大学) ; University of Victoria(维多利亚大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 PerfCoder通过可解释的定制化优化生成高性能代码,优于现有模型,在代码性能基准上实现更高效的优化策略。
约束衰减:后端代码生成中LLM代理的脆弱性
机构 * EURECOM ; University of Basilicata(巴利卡塔大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究探讨了LLM代理在多文件后端生成中处理结构约束的能力,发现随着约束累积,性能显著下降,且框架敏感性导致不同环境下的性能差异。
SWE-Pruner: 为编码代理设计的自适应上下文修剪
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE
AI总结 本文提出SWE-Pruner,一种针对编码代理的自适应上下文修剪框架,通过任务感知的动态修剪策略减少长上下文影响,提升代码生成效率与准确性。
Comments Code available at https://github.com/Ayanami1314/swe-pruner
对现实软件开发中主动编码助手的实证研究
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Fitten Tech Co., Ltd.(Fitten科技有限公司)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文通过大规模实证研究,分析了模拟与现实数据在主动意图预测中的差异,提出ProCodeBench基准,并指出模拟数据无法替代真实数据。
RECAP:一个端到端的平台,用于捕捉、回放和分析AI辅助编程交互
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 软件智能体 :workflow(abstract);分类 cs.CL、cs.SE
AI总结 RECAP通过记录和回放开发者与AI编程助手的交互,分析其行为模式和策略演变,为软件工程教育提供支持。
融合城市结构与语义:一种基于条件扩散模型的跨城市OD矩阵生成方法
机构 * Institute of Intelligent Computing, University of Electronic Science and Technology of China (UESTC)(电子科技大学智能计算研究所) ; College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) ; Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist)(信息科学与技术国家研究中心电子工程系) ; School of Information and Communication Engineering, University of Electronic Science and Technology of China (UESTC)(电子科技大学信息与通信工程学院)
专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SE DAN模型,通过融合城市语义与空间约束生成跨城市OD矩阵,实验显示其在RMSE上优于现有方法,并在不同城市场景中保持鲁棒性。
通过正则化自适应图卷积实现大规模道路网络高效交通预测
机构 * School of Computer Science and Engineering, Sun Yat-Sen University, China(中山大学计算机科学与工程学院) ; School of Artificial Intelligence, Sun Yat-Sen University, China(中山大学人工智能学院) ; Guangdong Key Laboratory of Big Data Analysis and Processing, China(广东大数据分析与处理重点实验室)
专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出正则化自适应图卷积模型,通过高效余弦操作和残差差分机制提升大规模交通网络预测效率与精度,实验表明其在多个真实数据集上均优于现有方法。
Comments Accepted by ICDE 2026
前沿编码代理如今可以实现一个AlphaZero自博弈机器学习流水线用于连接四游戏,其性能可与外部求解器相媲美
机构 * Department of Computer Science(计算机科学系) ; University of Chicago(芝加哥大学) ; Independent Researcher(独立研究员)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基准测试,评估前沿编码代理自主实现AlphaZero式机器学习流水线的能力,通过简洁任务描述而非完整前序工作参考,评估连接四游戏AI性能,发现Claude Opus 4.7在七次试验中胜过Pons求解器,其他代理表现欠佳。
AI辅助代码审查作为代码质量和自主学习的支架:经验报告
机构 * The University of Melbourne(墨尔本大学) ; University of Eastern Finland(东芬兰大学)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 本文探讨了AI辅助代码审查在软件工程教育中的应用,通过混合方法设计分析了学生自主学习过程,发现工具优化后技术问题显著减少,且AI审查的响应率稳定,提出了AI审查在教育中的设计和教学建议。
Comments 11 pages, 3 figures, 3 tables
HARBOR:自动化Harness优化
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出HARBOR框架,通过约束噪声贝叶斯优化解决Harness配置问题,强调自动化配置优于手动堆叠,并在生产编码代理中实例化。
SolidCoder:通过具体执行弥合LLM代码生成中的心理现实差距
机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电信研究所)
专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE
AI总结 SolidCoder通过强制边缘情况意识和沙盒执行解决心理现实差距,提升代码生成性能,实现HumanEval、CodeContests和APPS的高准确率。
Comments 23 pages, 2 figures, Accepted at Findings of ACL 2026
Debug2Fix: 交互式调试能否帮助编码代理修复更多错误?
机构 * Microsoft(微软)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出Debug2Fix框架,通过集成交互式调试子代理,提升编码代理在bug修复中的性能,实验显示在某些模型上性能提升超过20%,并证明更好的工具设计比切换更昂贵的模型更重要。
Comments In Review
循环中的偏见:用于软件工程的LLM作为评判者的审计
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。
Atropos:通过早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡
机构 * KAIST(韩国明知大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE
AI总结 本文提出Atropos技术,通过预测早期终止和模型热切换提升基于LLM的代理在自一致性下的成本效益权衡,实验表明其能将性能提升至闭合LLM的74.35%,成本降低至23.9%。
Comments Will appear at ISSTA 2026
数值不稳定性与混沌:量化大型语言模型的不可预测性
机构 * Department of Computer Science, Florida State University, Tallahassee, USA(佛罗里达州立大学计算机科学系,塔拉希西亚,美国) ; Department of Mathematics, Florida State University, Tallahassee, USA(佛罗里达州立大学数学系,塔拉希西亚,美国)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了大型语言模型中数值不稳定性导致的不可预测性,揭示了浮点精度限制下误差传播机制,识别出混沌效应及三种不同行为模式。
Comments 8 pages, 9 figures
代码低语者:结合图神经网络和大语言模型的代码和漏洞解决方法
专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 本文提出Code Whisperer框架,结合图分析与大语言模型,统一检测和修复代码维护性和安全性问题,提升检测性能和修复建议实用性。
Comments 10 Pages
形式架构描述符作为AI编码代理的导航原语
机构 * Independent Researcher(独立研究者)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文研究了通过提供形式架构描述符减少AI编码代理在代码库探索中的导航开销,通过实验和观察证明了架构描述符在导航效率和错误检测方面的显著提升。
Comments 4 pages, 4 tables, preprint. Code and data: https://doi.org/10.5281/zenodo.19500105
CCCE:一种基于知识图谱遍历和自适应决策门控的连续代码校准引擎,用于企业代码库的自主维护
机构 * Independent Researcher(独立研究员)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文提出CCCE,通过知识图谱遍历和自适应决策门控技术,实现企业代码库的自主维护,减少修复时间并提供端到端可追溯性。
WybeCoder:验证性 imperative 代码生成
机构 * CERMICS, ENPC, Institut Polytechnique de Paris, CNRS(CERMICS,ENPC,巴黎理工学院,CNRS) ; Computer Lab, University of Cambridge(剑桥大学计算机实验室) ; Korea Institute for Advanced Study(韩国高级研究院) ; FAIR, Meta(FAIR,Meta) ; University College London(伦敦大学学院)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 WybeCoder 提出了一种验证性 imperative 代码生成框架,通过证明与生成同步的方式,实现代码、不变式和证明的共同进化,提升了复杂算法的验证效率。