arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-27 至 2026-01-27 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 13 篇

2601.04886 2026-01-27 cs.SE cs.AI 84%

Analyzing Message-Code Inconsistency in AI Coding Agent-Authored Pull Requests

分析AI编码代理生成的拉取请求中的消息-代码不一致

Jingzhi Gong, Giovanni Pinna, Yixin Bian, Jie M. Zhang

机构 * King's College London(伦敦大学国王学院) University of Trieste(特里斯特大学) Harbin Normal University(哈尔滨师范大学)

专题命中 软件智能体 :agent(title);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究发现AI生成的PR描述中存在显著的消息-代码不一致问题,导致接受率降低和合并时间延长,需加强验证机制和生成优化以提升人机协作的可信度。

Comments Accepted by MSR'26 Mining Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18749 2026-01-27 cs.SE 83%

Let's Make Every Pull Request Meaningful: An Empirical Analysis of Developer and Agentic Pull Requests

让每个拉取请求都有意义:对开发者和代理拉取请求的实证分析

Haruhiko Yoshioka, Takahiro Monno, Haruka Tokumasu, Taiki Wakamatsu, Yuki Ota, Nimmi Weeraddana, Kenichi Matsumoto

专题命中 软件智能体 :agentic(title,abstract);AI agent(abstract);分类 cs.SE

AI总结 本研究通过分析40,214个PRs,发现提交者属性对合并结果影响最大,审查相关特征在人类和代理PRs中效果相反,揭示了人机协作提升PR质量的途径。

Comments Accepted for publication in the 23rd International Conference on Mining Software Repositories (MSR '26) : 5 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17627 2026-01-27 cs.SE 79%

Code Change Characteristics and Description Alignment: A Comparative Study of Agentic versus Human Pull Requests

代码变更特征与描述对齐:代理与人类拉取请求的比较研究

Dung Pham, Taher A. Ghaleb

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.SE

AI总结 研究比较了代理与人类生成的拉取请求在代码变更特征和描述质量上的差异,发现代理在提交级消息质量上表现更好,但在PR级总结上不如人类,揭示了代理在微观精确性与宏观沟通之间的差距。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13295 2026-01-27 cs.LG cs.AI cs.CL cs.MA cs.SI 75%

CooperBench: Why Coding Agents Cannot be Your Teammates Yet

CooperBench:为何编码代理还不能成为你的队友

Arpandeep Khatua, Hao Zhu, Peter Tran, Arya Prabhudesai, Frederic Sadrieh, Johann K. Lieberwirth, Xinkai Yu, Yicheng Fu, Michael J. Ryan, Jiaxin Pei, Diyi Yang

机构 * Stanford University(斯坦福大学) SAP Labs US(SAP美国实验室)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 CooperBench通过大规模协作编码任务测试,发现AI代理在团队协作中表现不佳,揭示了沟通障碍、承诺偏离和期望错误等关键问题,呼吁发展社交智能。

Comments https://cooperbench.com First two authors contribute equally. The 3th - 6th authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04427 2026-01-27 cs.SE cs.AI 73%

Speed at the Cost of Quality: How Cursor AI Increases Short-Term Velocity and Long-Term Complexity in Open-Source Projects

以质量为代价:Cursor AI如何在开源项目中提升短期速度和长期复杂性

Hao He, Courtney Miller, Shyam Agarwal, Christian Kästner, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究Cursor AI对开源项目开发速度和质量的影响,发现其短期提升速度但长期增加代码复杂性,指出质量保障是早期采用者的主要瓶颈。

Journal ref 23rd International Conference on Mining Software Repositories (MSR '26), April 13--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17406 2026-01-27 cs.SE 70%

Fingerprinting AI Coding Agents on GitHub

在GitHub上指纹识别AI编码代理

Taher A. Ghaleb

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 该研究通过分析GitHub上的拉取请求,识别AI编码代理的行为特征,揭示了AI生成代码的独特模式,为软件仓库中AI贡献的检测提供了新的方法。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18241 2026-01-27 cs.SE cs.AI 62%

TAM-Eval: Evaluating LLMs for Automated Unit Test Maintenance

TAM-Eval: 评估用于自动单元测试维护的LLM

Elena Bruches, Vadim Alperovich, Dari Baturova, Roman Derunets, Daniil Grebenkin, Georgy Mkrtchyan, Oleg Sedukhin, Mikhail Klementev, Ivan Bondarenko, Nikolay Bushkov, Stanislav Moiseev

机构 * Both authors contributed equally to this research.(共同作者)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 TAM-Eval提出一个评估LLM在自动单元测试维护能力的框架和基准,通过测试套件创建、修复和更新三个场景,揭示LLM在真实测试维护中的局限性。

Comments Accepted for publication at the 9th Workshop on Validation, Analysis and Evolution of Software Tests (VST 2026), co-located with the the 33rd IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17584 2026-01-27 cs.SE cs.AI 62%

Prompt Driven Development with Claude Code: Building a Complete TUI Framework for the Ring Programming Language

通过Claude Code驱动的开发:为环编程语言构建完整的终端用户界面框架

Mahmoud Samir Fayed, Ahmed Samir Fayed

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 通过Claude Code驱动开发,为环编程语言构建完整终端用户界面框架,展示了提示驱动方法在软件工程中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17133 2026-01-27 cs.LG cs.AI cs.CR cs.DC cs.MA 62%

Learning to Collaborate: An Orchestrated-Decentralized Framework for Peer-to-Peer LLM Federation

学习协作:一种协同-去中心化框架用于点对点大语言模型联邦

Inderjeet Singh, Eleonore Vissol-Gaudin, Andikan Otung, Motoyoshi Sekiya

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 KNEXA-FL通过协同去中心化框架提升点对点大语言模型联邦学习的效率与稳定性

Comments Accepted to AAAI 2026. 13 pages, 3 figures, 10 tables. Code available at: https://github.com/FujitsuResearch/knexa-fl

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18285 2026-01-27 cs.CL 57%

U-Fold: Dynamic Intent-Aware Context Folding for User-Centric Agents

U-Fold:面向用户中心任务的动态意图感知上下文折叠

Jin Su, Runnan Fang, Yeqiu Li, Xiaobin Wang, Shihao Cai, Pengjun Xie, Ningyu Zhang, Fajie Yuan

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Westlake University(西湖大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 U-Fold通过动态意图感知上下文折叠方法,提升用户为中心任务中长上下文处理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16946 2026-01-27 cs.SI cs.AI 57%

MobileCity: An Efficient Framework for Large-Scale Urban Behavior Simulation

MobileCity: 一种大规模城市行为模拟的高效框架

Xiaotong Ye, Nicolas Bougie, Toshihiko Yamasaki, Narimasa Watanabe

机构 * Woven by Toyota(丰田公司) The University of Tokyo(东京大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 MobileCity通过高效框架模拟真实城市行为,结合多种交通方式和本地模型提升效率,实现更真实的行为生成与应用拓展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18951 2026-01-27 cs.DB cs.AI 57%

SWE-SQL: Illuminating LLM Pathways to Solve User SQL Issues in Real-World Applications

SWE-SQL:揭示LLM解决现实应用中用户SQL问题的路径

Jinyang Li, Xiaolong Li, Ge Qu, Per Jacobsson, Bowen Qin, Binyuan Hui, Shuzheng Si, Nan Huo, Xiaohan Xu, Yue Zhang, Ziwei Tang, Yuanshuai Li, Florensia Widjaja, Xintong Zhu, Feige Zhou, Yongfeng Huang, Yannis Papakonstantinou, Fatma Ozcan, Chenhao Ma, Reynold Cheng

机构 * HKU STAR Lab(香港大学STAR实验室) Google Cloud(谷歌云) CUHKSZ(香港中文大学) CUHK(香港中文大学) THU(清华大学) The BIRD Team(BIRD团队)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 SWE-SQL通过引入BIRD-CRITIC基准和Six-Gym训练环境,提升开源模型解决SQL问题的能力,实现对复杂SQL调试任务的突破。

Comments 29 pages, 10 figures, NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14768 2026-01-27 physics.med-ph physics.optics 50%

Quantitative Stain Mapping in X-ray Virtual Histology

X射线虚拟组织学中的定量染色映射

Dominik John, David M. Paganin, Marie-Christine Zdora, Lisa Marie Petzold, Patrick Ilg, Junan Chen, Sara Baggio, Johannes B. Thalhammer, Sami Wirtensohn, Julian Moosmann, Jörg U. Hammel, Felix Beckmann, Samantha J. Alloo, Jannis Ahlers, Madleen Busse, Julia Herzen, Kaye S. Morgan

专题命中 软件智能体 :agent(abstract)

AI总结 本研究提出一种X射线虚拟组织学方法,通过调制基成像技术同时获取电子数密度和X射线衰减值,实现组织体积的基材料分解,提取三维染色分布图和微米级形态学细节,验证其准确性并建立X射线到可见光成像的直接桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏