arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-24 至 2026-02-24 共收录 10 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 10 篇

2602.19441 2026-02-24 cs.SE cs.AI 81%

When AI Teammates Meet Code Review: Collaboration Signals Shaping the Integration of Agent-Authored Pull Requests

当AI队友遇见代码审查:协作信号塑造代理编写的拉取请求整合

Costain Nachuma, Minhaz Zibran

机构 * Idaho State University USA(爱达荷州立大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了AI代理提交的拉取请求在代码审查中的整合效果,发现审查员参与和协作信号对整合成功至关重要。

Comments 5 pages, 2 figures, 1 table. Accepted at the 23rd International Conference on Mining Software Repositories (MSR 2026), Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01317 2026-02-24 cs.CR cs.AI 79%

TxRay: Agentic Postmortem of Live Blockchain Attacks

TxRay:活区块链攻击的代理事后分析

Ziyue Wang, Jiangshan Yu, Kaihua Qin, Dawn Song, Arthur Gervais, Liyi Zhou

机构 * Decentralized Intelligence AG(去中心化智能AG) The University of Sydney(悉尼大学) University of Warwick(沃里克大学) University of California, Berkeley(加州大学伯克利分校) University College London(伦敦大学学院)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 TxRay通过代理系统利用LLM和工具调用,从有限证据中重建活区块链攻击,生成可执行的PoC并验证根本原因,提升攻击分析效率和覆盖范围。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23546 2026-02-24 math.OC stat.ML 78%

Going from a Representative Agent to Counterfactuals in Combinatorial Choice

从代表性代理人到反事实的组合选择

Yanqiu Ruan, Karthyek Murthy, Karthik Natarajan

专题命中 软件智能体 :agent(title,abstract)

AI总结 本文提出了一种基于代表性代理人模型的非参数反事实推断方法,通过线性规划和混合整数凸规划解决数据一致性问题,并在合成数据上验证了其预测精度和鲁棒性。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04847 2026-02-24 cs.LG 77%

Test-Time Adaptation for LLM Agents via Environment Interaction

通过环境交互实现LLM代理的测试时适应

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

机构 * University of Waterloo(滑铁卢大学) Salesforce AI Research(Salesforce AI研究)

专题命中 软件智能体 :agent(abstract);function calling(abstract);agentic(abstract);分类 cs.LG

AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。

Comments Our code is available here: https://github.com/r2llab/GTTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20048 2026-02-24 cs.AI cs.SE 76%

CodeCompass: Navigating the Navigation Paradox in Agentic Code Intelligence

CodeCompass: 在代理代码智能中导航悖论的探索

Tarakanath Paipuru

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.SE

AI总结 CodeCompass通过基于图的结构导航提升代码智能代理在隐藏依赖任务中的性能,揭示导航与检索本质不同,需显式引导代理利用结构上下文。

Comments 23 pages, 7 figures. Research study with 258 trials on SWE-bench-lite tasks. Code and data: https://github.com/tpaip607/research-codecompass

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11867 2026-02-24 cs.SE cs.AI 73%

AI-Augmented CI/CD Pipelines: From Code Commit to Production with Autonomous Decisions

AI增强的CI/CD流水线:从代码提交到生产中的自主决策

Mohammad Baqar, Saba Naqvi, Rajat Khanda

专题命中 软件智能体 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AI增强的CI/CD流水线,利用大语言模型和自主代理提升软件交付效率,通过参考架构、决策分类法和信任层级框架实现自动化决策,减少人工干预和延迟。

Comments 13 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10471 2026-02-24 cs.SE cs.CL 62%

TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation

TestExplora: 通过仓库级测试生成对LLMs进行主动bug发现的基准测试

Steven Liu, Jane Luo, Xin Zhang, Aofan Liu, Hao Liu, Jie Wu, Ziyang Huang, Yangyu Huang, Yu Kang, Scarlett Li

机构 * Microsoft(微软公司) School of ECE, Peking University(北京大学电子工程学院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.SE

AI总结 TestExplora通过仓库级测试生成评估LLMs在主动bug发现中的能力,揭示了当前模型在复杂交互和代理探索方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19594 2026-02-24 cs.LG 57%

ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?

ISO-Bench: 编码代理能否优化现实世界的推理工作负载?

Ayush Nangia, Shikhar Mishra, Aman Gokrani, Paras Chopra

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 ISO-Bench通过结合硬指标和软指标评估编码代理在现实世界推理优化任务中的能力,发现无单一代理占优,且模型与支架均影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20082 2026-02-24 cs.PL 50%

Machine-Generated, Machine-Checked Proofs for a Verified Compiler (Experience Report)

机器生成、机器验证的证明用于验证编译器(经验报告)

Zoe Paraskevopoulou

专题命中 软件智能体 :agentic(abstract)

AI总结 利用机器学习模型生成并验证编译器正确性证明,通过模板技术实现ANF转换的语义保持性证明,耗时96小时完成,展示了机器辅助证明的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏