A Roadmap on Modern Code Review: Challenges and Opportunities
现代代码审查的路线图:挑战与机遇
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出现代代码审查的路线图,通过三个范式转变推动其向智能、包容的未来演进。
Comments This paper is accepted by TOSEM
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
现代代码审查的路线图:挑战与机遇
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出现代代码审查的路线图,通过三个范式转变推动其向智能、包容的未来演进。
Comments This paper is accepted by TOSEM
检测修复验证以确保LLM生成的代码安全:一个多语言实证研究
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文通过多语言实证研究,提出了一种用于确保LLM生成代码安全的检测-修复-验证流程,并构建了新的基准数据集以评估不同修复方法的有效性。
基于图的SDN配置代码合成
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 GraphCue通过拓扑感知检索和约束条件生成,实现了SDN配置代码合成的高通过率和高效验证。
Comments 2 pages, 2 figures
Journal ref IEEE Consumer Communications & Networking Conference 2026
RepoMod-Bench: 一个通过实现无关测试进行代码仓库现代化的基准测试
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 RepoMod-Bench通过实现无关测试评估代码仓库现代化,揭示大规模自主现代化的挑战。
用于进化算法参数控制的代码世界模型
机构 * ICN2 -- Catalan Institute of Nanoscience ; Nanotechnology, Barcelona, Spain Artificial Intelligence Research Institute (IIIA-CSIC), Barcelona, Spain Universitat Polit\` e cnica de Catalunya (UPC), Barcelona, Spain
专题命中 软件智能体 :planning(abstract);分类 cs.LG
AI总结 本文提出利用代码世界模型进行进化算法参数控制,通过模拟器实现高效突变强度选择,在多个基准测试中表现出色。
基于大语言模型的接受测试生成:一项工业案例研究
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文研究了利用大语言模型生成Web应用验收测试的两步方法,通过工业案例验证了其在提高测试质量和效率方面的有效性。
Journal ref 2025 IEEE/ACM International Conference on Automation of Software Test (AST)
ISO-Bench: 编码代理能否优化现实世界的推理工作负载?
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 ISO-Bench通过结合硬指标和软指标评估编码代理在现实世界推理优化任务中的能力,发现无单一代理占优,且模型与支架均影响性能。
HeurekaBench: 一个用于AI合作者的基准评估框架
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))
专题命中 软件智能体 :agentic(abstract);分类 cs.LG
AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。
Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026
AnCoder:通过离散扩散模型实现锚定代码生成
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 软件智能体 :planning(abstract);分类 cs.LG
AI总结 AnCoder通过结构化锚定扩散模型实现高质量代码生成,解决了传统方法无法尊重编程语言结构的问题。
不仅仅为开发者:探索知识导向社区的插件维护
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究探讨了非开发者主导社区中插件生态系统的维护,通过分析Obsidian平台的插件发现六个知识管理相关主题,并揭示了其工程结构和可持续性问题。
Comments Accepted to SANER2026
M2F:大规模数学文献的自动化形式化
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) ; Huawei Technologies(华为技术有限公司) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 M2F通过端到端自动化形式化框架,在三周内将教科书转化为Lean库,实现96%的证明成功率。
递归语言模型用于对抗检测:一种针对工具增强代理的程序性防御
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 本文提出基于递归语言模型的RLM-JB框架,通过程序化方法检测对抗性输入,实现高检测效果与高精度的平衡。
Comments 5 pages and 1 figure. Appendix: an additional 5 pages
基于算法的可靠且意图保留的代码翻译管道
专题命中 软件智能体 :planning(abstract);分类 cs.SE
AI总结 本文提出一种基于算法的代码翻译管道,通过引入语言中立的中间规范提升翻译准确性和可靠性,实验结果显示其在多个指标上均优于直接翻译方法。
Comments Accepted at 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)
从工具编排到代码执行:MCP设计选择的研究
机构 * Faculty of Computer and Information Science(计算机与信息科学学院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文研究了MCP设计选择对可扩展性和安全性的平衡,提出通过代码执行能力提升智能体流程的效率,并通过安全框架应对扩展带来的攻击风险。
SecRepoBench:用于现实世界仓库中安全代码补全的代码代理基准测试
机构 * University of Maryland(马里兰大学) ; Google Deepmind(谷歌DeepMind)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 SecRepoBench通过评估代码代理在现实世界仓库中进行安全代码补全的能力,揭示了代码代理在生成正确且安全代码方面的优势及改进方向。
LLM生态系统中的隐藏许可风险
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出LiAgent框架,通过LLM分析LLMware生态系统的许可证兼容性,显著提升检测性能,发现多个潜在的许可证冲突问题。
跟随龙:基于代码审查的模糊测试
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 EyeQ通过利用代码审查中的开发者智能,指导模糊测试以发现更多安全关键的漏洞。
ContextBench: 一种用于编码代理代码上下文检索的基准测试
机构 * Nanjing University(南京大学) ; University College London(伦敦大学学院)
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 ContextBench通过评估编码代理在问题解决过程中代码上下文的检索能力,揭示了代理在上下文利用上的不足,为改进LLM在软件任务中的推理提供了新的研究方向。
Comments 36 pages, 6 figures, 4 tables
分析 nf-core 流水线中的 GitHub 问题和拉取请求:对 nf-core 流水线仓库的洞察
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文通过分析 nf-core 流水线的 GitHub 问题和拉取请求,揭示了开发和维护过程中面临的挑战,如工具开发、仓库维护及 CI 配置管理,并提出提升流水线可持续性和可重复性的方法。
Comments 12 pages
环境在环:重新思考基于LLM代理的代码迁移
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出了一种整合自动环境设置与代码迁移流程的框架,强调自动环境交互对代码迁移自动化的重要性。
测试与突变:对抗性LLM代理用于鲁棒性单元测试生成
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 AdverTest通过对抗性代理提升单元测试生成的鲁棒性,提高故障检测率和覆盖率
AI编程助手的马太效应:软件演化的隐藏偏见
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文研究了AI编程助手对软件生态系统的影响,发现主流语言和框架因数据丰富而获得更优支持,揭示了软件演化的隐藏偏见。
LGMSNet: 通过双级多尺度融合来简化医学图像分割模型
机构 * School of Biomedical Engineering, Division of Life Sciences ; Medicine, University of Science ; Center for Medical Imaging, Robotics, Analytic Computing \& Learning (MIRACLE), Suzhou Institute for Advance Research, USTC, Suzhou, 215123, China ; Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, Beijing, 100190, China ; Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou, 215123, China ; State Key Laboratory of Precision \& Intelligent Chemistry, USTC, Hefei, China
专题命中 软件智能体 :planning(abstract);分类 cs.AI
AI总结 LGMSNet通过双级多尺度融合技术,实现轻量级医学图像分割模型的高效性能与高泛化能力。
Comments Accepted by ECAI 2025
Journal ref Frontiers in Artificial Intelligence and Applications, 413, 739-746 (2025)
Meta SecAlign: 一种针对提示注入攻击的 secure LLM 基础
机构 * FAIR at Meta(Meta 的 FAIR 部门) ; UC Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 Meta SecAlign 是首个开源的 LLM,具备内置的模型级防御,实现了商业级性能,且在复杂代理任务中表现优异,同时在提示注入攻击中展现出更高的安全性。
仅通过测试代码可以对不稳定测试进行分类吗?基于LLM的经验研究
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本研究探讨了仅通过测试代码是否能有效分类不稳定测试,发现LLM在无额外上下文时表现有限,需进一步结合检索增强生成等方法提升泛化能力。
Comments 10 pages, 3 figures, 7 tables, 33rd IEEE International Conference on Software Analysis, Evolution and Reengineering: Reproducibility Studies and Negative Results (SANER-RENE 2025)
SemPipes -- 可优化的语义数据运算符用于表格机器学习流水线
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 SemPipes通过LLM驱动的语义数据运算符提升表格机器学习流水线的预测性能和效率。
通过熵增强的多轮偏好优化构建编码代理
机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) ; Meta AI, Bellevue, USA(Meta AI)
专题命中 软件智能体 :tool use(abstract);分类 cs.AI
AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。
SWE-Refactor:一个面向真实世界的基于大语言模型的代码重构仓库级基准
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 SWE-Refactor是一个面向真实世界的基于大语言模型的代码重构仓库级基准,通过1099个Java项目中的重构实例评估九种LLMs,揭示复杂重构的失败率较高。
在基于直觉模糊偏好的冲突情境中可行的解决策略
机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(长沙理工大学数学与统计学学院) ; Hunan Provincial Key Laboratory of Mathematical Modeling and Analysis in Engineering, Changsha University of Science and Technology(湖南省工程数学建模与分析重点实验室,长沙理工大学) ; Department of Computer Science, University of Manitoba(曼尼托湾大学计算机科学系)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于直觉模糊偏好的冲突情境模型,通过更精细的粒度捕捉冲突本质,并开发了相应的冲突度量和调整机制,以提高冲突解决的可行性。
DMAVA:基于Autoware的分布式多自主车辆架构
机构 * Faculty of Engineering(工程学院) ; Applied Science(应用科学) ; Ontario Tech University(安大略技术大学)
专题命中 软件智能体 :planning(abstract);分类 cs.AI
AI总结 DMAVA是一种基于Autoware的分布式多自主车辆架构,通过集成ROS 2、Autoware Universe等工具,实现多车辆在分布式环境下的协同控制与一致行为。
Comments 7 pages, 3 figures, 5 tables, Submitted to IEEE IV 2026, Demo videos and source code available