arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3270 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3270 篇

2405.18216 2026-03-03 cs.SE 57%

A Roadmap on Modern Code Review: Challenges and Opportunities

现代代码审查的路线图:挑战与机遇

Zezhou Yang, Cuiyun Gao, Zhaoqiang Guo, Zhenhao Li, Kui Liu, Xin Xia, Yuming Zhou

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出现代代码审查的路线图,通过三个范式转变推动其向智能、包容的未来演进。

Comments This paper is accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00897 2026-03-03 cs.SE 57%

Detect Repair Verify for Securing LLM Generated Code: A Multi-Language Empirical Study

检测修复验证以确保LLM生成的代码安全:一个多语言实证研究

Cheng Cheng

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过多语言实证研究,提出了一种用于确保LLM生成代码安全的检测-修复-验证流程,并构建了新的基准数据集以评估不同修复方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17371 2026-03-03 cs.SE 57%

GraphCue for SDN Configuration Code Synthesis

基于图的SDN配置代码合成

Haomin Qi, Fengfei Yu, Chengbo Huang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 GraphCue通过拓扑感知检索和约束条件生成,实现了SDN配置代码合成的高通过率和高效验证。

Comments 2 pages, 2 figures

Journal ref IEEE Consumer Communications & Networking Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22518 2026-02-27 cs.SE 57%

RepoMod-Bench: A Benchmark for Code Repository Modernization via Implementation-Agnostic Testing

RepoMod-Bench: 一个通过实现无关测试进行代码仓库现代化的基准测试

Xuefeng Li, Nir Ben-Israel, Yotam Raz, Belal Ahmed, Doron Serebro, Antoine Raux

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 RepoMod-Bench通过实现无关测试评估代码仓库现代化,揭示大规模自主现代化的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22260 2026-02-27 cs.LG cs.NE 57%

Code World Models for Parameter Control in Evolutionary Algorithms

用于进化算法参数控制的代码世界模型

Camilo Chacón Sartori, Guillem Rodríguez Corominas

机构 * ICN2 -- Catalan Institute of Nanoscience Nanotechnology, Barcelona, Spain Artificial Intelligence Research Institute (IIIA-CSIC), Barcelona, Spain Universitat Polit\` e cnica de Catalunya (UPC), Barcelona, Spain

专题命中 软件智能体 :planning(abstract);分类 cs.LG

AI总结 本文提出利用代码世界模型进行进化算法参数控制,通过模拟器实现高效突变强度选择,在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07244 2026-02-26 cs.SE 57%

Acceptance Test Generation with Large Language Models: An Industrial Case Study

基于大语言模型的接受测试生成:一项工业案例研究

Margarida Ferreira, Luis Viegas, Joao Pascoal Faria, Bruno Lima

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文研究了利用大语言模型生成Web应用验收测试的两步方法,通过工业案例验证了其在提高测试质量和效率方面的有效性。

Journal ref 2025 IEEE/ACM International Conference on Automation of Software Test (AST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19594 2026-02-24 cs.LG 57%

ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?

ISO-Bench: 编码代理能否优化现实世界的推理工作负载?

Ayush Nangia, Shikhar Mishra, Aman Gokrani, Paras Chopra

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 ISO-Bench通过结合硬指标和软指标评估编码代理在现实世界推理优化任务中的能力,发现无单一代理占优,且模型与支架均影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17688 2026-02-23 cs.LG cs.PL 57%

AnCoder: Anchored Code Generation via Discrete Diffusion Models

AnCoder:通过离散扩散模型实现锚定代码生成

Anton Xue, Litu Rout, Constantine Caramanis, Sanjay Shakkottai

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :planning(abstract);分类 cs.LG

AI总结 AnCoder通过结构化锚定扩散模型实现高质量代码生成,解决了传统方法无法尊重编程语言结构的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17018 2026-02-20 cs.SE 57%

Not Only for Developers: Exploring Plugin Maintenance for Knowledge-Centric Communities

不仅仅为开发者:探索知识导向社区的插件维护

Giovanni Rosa, David Moreno-Lumbreras, Raula Gaikovina Kula

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究探讨了非开发者主导社区中插件生态系统的维护,通过分析Obsidian平台的插件发现六个知识管理相关主题,并揭示了其工程结构和可持续性问题。

Comments Accepted to SANER2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17016 2026-02-20 cs.AI 57%

M2F: Automated Formalization of Mathematical Literature at Scale

M2F:大规模数学文献的自动化形式化

Zichen Wang, Wanli Ma, Zhenyu Ming, Gong Zhang, Kun Yuan, Zaiwen Wen

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Huawei Technologies(华为技术有限公司) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 M2F通过端到端自动化形式化框架,在三周内将教科书转化为Lean库,实现96%的证明成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16520 2026-02-19 cs.CR cs.AI 57%

Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents

递归语言模型用于对抗检测:一种针对工具增强代理的程序性防御

Doron Shavit

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本文提出基于递归语言模型的RLM-JB框架,通过程序化方法检测对抗性输入,实现高检测效果与高精度的平衡。

Comments 5 pages and 1 figure. Appendix: an additional 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16106 2026-02-19 cs.SE 57%

Algorithm-Based Pipeline for Reliable and Intent-Preserving Code Translation with LLMs

基于算法的可靠且意图保留的代码翻译管道

Shahriar Rumi Dipto, Saikat Mondal, Chanchal K. Roy

专题命中 软件智能体 :planning(abstract);分类 cs.SE

AI总结 本文提出一种基于算法的代码翻译管道,通过引入语言中立的中间规范提升翻译准确性和可靠性,实验结果显示其在多个指标上均优于直接翻译方法。

Comments Accepted at 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15945 2026-02-19 cs.CR cs.AI 57%

From Tool Orchestration to Code Execution: A Study of MCP Design Choices

从工具编排到代码执行:MCP设计选择的研究

Yuval Felendler, Parth A. Gandhi, Idan Habler, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文研究了MCP设计选择对可扩展性和安全性的平衡,提出通过代码执行能力提升智能体流程的效率,并通过安全框架应对扩展带来的攻击风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21205 2026-02-17 cs.CR cs.AI 57%

SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories

SecRepoBench:用于现实世界仓库中安全代码补全的代码代理基准测试

Chihao Shen, Connor Dilgren, Purva Chiniya, Luke Griffith, Yu Ding, Yizheng Chen

机构 * University of Maryland(马里兰大学) Google Deepmind(谷歌DeepMind)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 SecRepoBench通过评估代码代理在现实世界仓库中进行安全代码补全的能力,揭示了代码代理在生成正确且安全代码方面的优势及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10758 2026-02-12 cs.SE 57%

Hidden Licensing Risks in the LLMware Ecosystem

LLM生态系统中的隐藏许可风险

Bo Wang, Yueyang Chen, Jieke Shi, Minghui Li, Yunbo Lyu, Yinan Wu, Youfang Lin, Zhou Yang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出LiAgent框架,通过LLM分析LLMware生态系统的许可证兼容性,显著提升检测性能,发现多个潜在的许可证冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10487 2026-02-12 cs.CR cs.SE 57%

Following Dragons: Code Review-Guided Fuzzing

跟随龙:基于代码审查的模糊测试

Viet Hoang Luu, Amirmohammad Pasdar, Wachiraphan Charoenwet, Toby Murray, Shaanan Cohney, Van-Thuan Pham

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 EyeQ通过利用代码审查中的开发者智能,指导模糊测试以发现更多安全关键的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05892 2026-02-12 cs.LG 57%

ContextBench: A Benchmark for Context Retrieval in Coding Agents

ContextBench: 一种用于编码代理代码上下文检索的基准测试

Han Li, Letian Zhu, Bohan Zhang, Rili Feng, Jiaming Wang, Yue Pan, Earl T. Barr, Federica Sarro, Zhaoyang Chu, He Ye

机构 * Nanjing University(南京大学) University College London(伦敦大学学院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 ContextBench通过评估编码代理在问题解决过程中代码上下文的检索能力,揭示了代理在上下文利用上的不足,为改进LLM在软件任务中的推理提供了新的研究方向。

Comments 36 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09612 2026-02-12 cs.SE 57%

Analyzing GitHub Issues and Pull Requests in nf-core Pipelines: Insights into nf-core Pipeline Repositories

分析 nf-core 流水线中的 GitHub 问题和拉取请求:对 nf-core 流水线仓库的洞察

Khairul Alam, Banani Roy

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过分析 nf-core 流水线的 GitHub 问题和拉取请求,揭示了开发和维护过程中面临的挑战,如工具开发、仓库维护及 CI 配置管理,并提出提升流水线可持续性和可重复性的方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09944 2026-02-11 cs.SE 57%

Environment-in-the-Loop: Rethinking Code Migration with LLM-based Agents

环境在环:重新思考基于LLM代理的代码迁移

Xiang Li, Zhiwei Fei, Ying Ma, Jerry Zhang, Sarro Federica, He Ye

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出了一种整合自动环境设置与代码迁移流程的框架,强调自动环境交互对代码迁移自动化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08146 2026-02-11 cs.SE 57%

Test vs Mutant: Adversarial LLM Agents for Robust Unit Test Generation

测试与突变:对抗性LLM代理用于鲁棒性单元测试生成

Pengyu Chang, Yixiong Fang, Silin Chen, Yuling Shi, Beijun Shen, Xiaodong Gu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 AdverTest通过对抗性代理提升单元测试生成的鲁棒性,提高故障检测率和覆盖率

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23261 2026-02-10 cs.SE 57%

The Matthew Effect of AI Programming Assistants: A Hidden Bias in Software Evolution

AI编程助手的马太效应:软件演化的隐藏偏见

Fei Gu, Zi Liang, Jiahao MA, Hongzong LI

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文研究了AI编程助手对软件生态系统的影响,发现主流语言和框架因数据丰富而获得更优支持,揭示了软件演化的隐藏偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15476 2026-02-10 cs.CV cs.AI 57%

LGMSNet: Thinning a medical image segmentation model via dual-level multiscale fusion

LGMSNet: 通过双级多尺度融合来简化医学图像分割模型

Chengqi Dong, Fenghe Tang, Rongge Mao, Xinpei Gao, S. Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences Medicine, University of Science Center for Medical Imaging, Robotics, Analytic Computing \& Learning (MIRACLE), Suzhou Institute for Advance Research, USTC, Suzhou, 215123, China Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, Beijing, 100190, China Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou, 215123, China State Key Laboratory of Precision \& Intelligent Chemistry, USTC, Hefei, China

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 LGMSNet通过双级多尺度融合技术,实现轻量级医学图像分割模型的高效性能与高泛化能力。

Comments Accepted by ECAI 2025

Journal ref Frontiers in Artificial Intelligence and Applications, 413, 739-746 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02735 2026-02-09 cs.CR cs.AI 57%

Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks

Meta SecAlign: 一种针对提示注入攻击的 secure LLM 基础

Sizhe Chen, Arman Zharmagambetov, David Wagner, Chuan Guo

机构 * FAIR at Meta(Meta 的 FAIR 部门) UC Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 Meta SecAlign 是首个开源的 LLM,具备内置的模型级防御,实现了商业级性能,且在复杂代理任务中表现优异,同时在提示注入攻击中展现出更高的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05465 2026-02-06 cs.SE 57%

Can We Classify Flaky Tests Using Only Test Code? An LLM-Based Empirical Study

仅通过测试代码可以对不稳定测试进行分类吗?基于LLM的经验研究

Alexander Berndt, Vekil Bekmyradov, Rainer Gemulla, Marcus Kessel, Thomas Bach, Sebastian Baltes

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本研究探讨了仅通过测试代码是否能有效分类不稳定测试,发现LLM在无额外上下文时表现有限,需进一步结合检索增强生成等方法提升泛化能力。

Comments 10 pages, 3 figures, 7 tables, 33rd IEEE International Conference on Software Analysis, Evolution and Reengineering: Reproducibility Studies and Negative Results (SANER-RENE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05134 2026-02-06 cs.LG cs.DB 57%

SemPipes -- Optimizable Semantic Data Operators for Tabular Machine Learning Pipelines

SemPipes -- 可优化的语义数据运算符用于表格机器学习流水线

Olga Ovcharenko, Matthias Boehm, Sebastian Schelter

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 SemPipes通过LLM驱动的语义数据运算符提升表格机器学习流水线的预测性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 57%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 软件智能体 :tool use(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03712 2026-02-04 cs.SE 57%

SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring

SWE-Refactor:一个面向真实世界的基于大语言模型的代码重构仓库级基准

Yisen Xu, Jinqiu Yang, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 SWE-Refactor是一个面向真实世界的基于大语言模型的代码重构仓库级基准,通过1099个Java项目中的重构实例评估九种LLMs,揭示复杂重构的失败率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03403 2026-02-04 cs.AI 57%

Feasible strategies for conflict resolution within intuitionistic fuzzy preference-based conflict situations

在基于直觉模糊偏好的冲突情境中可行的解决策略

Guangming Lang, Mingchuan Shang, Mengjun Hu, Jie Zhou, Feng Xu

机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(长沙理工大学数学与统计学学院) Hunan Provincial Key Laboratory of Mathematical Modeling and Analysis in Engineering, Changsha University of Science and Technology(湖南省工程数学建模与分析重点实验室,长沙理工大学) Department of Computer Science, University of Manitoba(曼尼托湾大学计算机科学系)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于直觉模糊偏好的冲突情境模型,通过更精细的粒度捕捉冲突本质,并开发了相应的冲突度量和调整机制,以提高冲突解决的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16336 2026-02-03 cs.RO cs.AI cs.MA 57%

DMAVA: Distributed Multi-Autonomous Vehicle Architecture Using Autoware

DMAVA:基于Autoware的分布式多自主车辆架构

Zubair Islam, Mohamed El-Darieby

机构 * Faculty of Engineering(工程学院) Applied Science(应用科学) Ontario Tech University(安大略技术大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 DMAVA是一种基于Autoware的分布式多自主车辆架构,通过集成ROS 2、Autoware Universe等工具,实现多车辆在分布式环境下的协同控制与一致行为。

Comments 7 pages, 3 figures, 5 tables, Submitted to IEEE IV 2026, Demo videos and source code available

详情

展开后加载摘要…

URL PDF HTML 收藏