arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3270 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3270 篇

2509.11708 2026-02-03 cs.SE 57%

From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation

从评估到增强:大型语言模型在零知识证明代码生成中的应用

Zhantong Xue, Pingchuan Ma, Zhaoyu Wang, Yuguang Zhou, Xiaoqin Zhang, Shuai Wang, Juergen Rahmel

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22414 2026-02-03 cs.SE 57%

AutoCodeSherpa: Symbolic Explanations in AI Coding Agents

AutoCodeSherpa: AI 编程代理中的符号解释

Sungmin Kang, Haifeng Ruan, Abhik Roychoudhury

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 AutoCodeSherpa通过符号公式提供软件问题解释,提升自动化修复和程序分析的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00409 2026-02-03 cs.SE 57%

Are Coding Agents Generating Over-Mocked Tests? An Empirical Study

编码代理是否生成过度的模拟测试?一项实证研究

Andre Hora, Romain Robbes

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究了编码代理生成测试中模拟的使用情况,发现代理更倾向于修改测试并添加模拟,同时指出模拟测试可能更容易自动生成但验证效果较弱。

Comments Accepted for publication at MSR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00117 2026-02-03 cs.CV cs.AI 57%

IC-EO: Interpretable Code-based assistant for Earth Observation

IC-EO: 可解释的基于代码的地球观测助手

Lamia Lahouel, Laurynas Lopata, Simon Gruening, Gabriele Meoni, Gaetan Petit, Sylvain Lobry

机构 * Université Paris Cité, LIPADE, F-75006 Paris, France askEarth AG, Zurich, Switzerland ESA -lab, Frascati, Italy ESA, Advanced Concepts Studies Office, Noordwijk, the Netherlands

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 IC-EO提出一个可解释的代码生成助手,通过生成可审计的Python工作流程,提升地球观测分析的透明性和可复现性,优于现有基线模型。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21102 2026-01-30 cs.SE 57%

The Quiet Contributions: Insights into AI-Generated Silent Pull Requests

静默贡献:对AI生成的静默拉取请求的洞察

S M Mahedy Hasan, Md Fazle Rabbi, Minhaz Zibran

专题命中 软件智能体 :AI agent(abstract);分类 cs.SE

AI总结 研究首次分析了AI生成的静默拉取请求对代码质量和安全的影响,揭示其接受或拒绝的潜在原因。

Comments 5 pages, 4 figures, accepted at MSR Mining Challenge 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19367 2026-01-28 cs.CR cs.LG 57%

CHEHAB RL: Learning to Optimize Fully Homomorphic Encryption Computations

CHEHAB RL: 学习优化完全同态加密计算

Bilel Sefsaf, Abderraouf Dandani, Abdessamed Seddiki, Arab Mohammed, Eduardo Chielle, Michail Maniatakos, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 CHEHAB RL通过深度强化学习自动优化FHE代码,提升执行速度和减少噪声,编译过程更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12360 2026-01-28 cs.SE 57%

Discovering 100+ Compiler Defects in 72 Hours via LLM-Driven Semantic Logic Recomposition

通过LLM驱动的语义逻辑重组发现100余项编译器缺陷

Xingbang He, Yuanwei Chen, Hao Wu, Jikang Zhang, Zicheng Wang, Ligeng Chen, Junjie Peng, Haiyang Wei, Yi Qian, Tiantai Zhang, Linzhang Wang, Bing Mao

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 FeatureFuzz通过语义逻辑重组发现编译器缺陷,有效提升模糊测试的多样性与发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00753 2026-01-28 cs.SE 57%

Early-Stage Prediction of Review Effort in AI-Generated Pull Requests

AI生成拉取请求中早期阶段的审查努力预测

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Pham Phu Hoa, Tran Chi Nguyen, Nguyen Dinh Ha Duong, Truong Bao Tran

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本研究提出一种基于创建时间的电路断开模型,用于预测AI生成拉取请求的高维护需求,通过静态复杂性线索识别高成本贡献,提升维护效率。

Comments 5 pages, 4 figures. Accepted to the 23rd International Conference on Mining Software Repositories (MSR '26)

Journal ref 23rd International Conference on Mining Software Repositories (MSR '26), April 13-14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18285 2026-01-27 cs.CL 57%

U-Fold: Dynamic Intent-Aware Context Folding for User-Centric Agents

U-Fold:面向用户中心任务的动态意图感知上下文折叠

Jin Su, Runnan Fang, Yeqiu Li, Xiaobin Wang, Shihao Cai, Pengjun Xie, Ningyu Zhang, Fajie Yuan

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Westlake University(西湖大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 U-Fold通过动态意图感知上下文折叠方法,提升用户为中心任务中长上下文处理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16946 2026-01-27 cs.SI cs.AI 57%

MobileCity: An Efficient Framework for Large-Scale Urban Behavior Simulation

MobileCity: 一种大规模城市行为模拟的高效框架

Xiaotong Ye, Nicolas Bougie, Toshihiko Yamasaki, Narimasa Watanabe

机构 * Woven by Toyota(丰田公司) The University of Tokyo(东京大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 MobileCity通过高效框架模拟真实城市行为,结合多种交通方式和本地模型提升效率,实现更真实的行为生成与应用拓展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18951 2026-01-27 cs.DB cs.AI 57%

SWE-SQL: Illuminating LLM Pathways to Solve User SQL Issues in Real-World Applications

SWE-SQL:揭示LLM解决现实应用中用户SQL问题的路径

Jinyang Li, Xiaolong Li, Ge Qu, Per Jacobsson, Bowen Qin, Binyuan Hui, Shuzheng Si, Nan Huo, Xiaohan Xu, Yue Zhang, Ziwei Tang, Yuanshuai Li, Florensia Widjaja, Xintong Zhu, Feige Zhou, Yongfeng Huang, Yannis Papakonstantinou, Fatma Ozcan, Chenhao Ma, Reynold Cheng

机构 * HKU STAR Lab(香港大学STAR实验室) Google Cloud(谷歌云) CUHKSZ(香港中文大学) CUHK(香港中文大学) THU(清华大学) The BIRD Team(BIRD团队)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 SWE-SQL通过引入BIRD-CRITIC基准和Six-Gym训练环境,提升开源模型解决SQL问题的能力,实现对复杂SQL调试任务的突破。

Comments 29 pages, 10 figures, NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12146 2026-01-26 cs.SE 57%

From LLMs to Agents in Programming: The Impact of Providing an LLM with a Compiler

从LLM到代理:提供编译器对编程的影响

Viktor Kjellberg, Miroslaw Staron, Farnaz Fotrousi

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究了提供编译器如何提升LLM在编程任务中的表现,发现编译器能显著提高编译成功率并减少错误,且小型模型在某些情况下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13754 2026-01-21 cs.SE 57%

On Autopilot? An Empirical Study of Human-AI Teaming and Review Practices in Open Source

自动驾驶?开源软件中人类与AI协作及审查实践的实证研究

Haoyu Gao, Peerachai Banyongrakkul, Hao Guan, Mansooreh Zahedi, Christoph Treude

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本研究通过分析开源项目中AI辅助PR的互动模式,发现非所有权贡献者提交的AI共同撰写的PR被快速合并且反馈极少,揭示了AI在软件工程中的协作与审查实践问题。

Comments accepted as MSR short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11510 2026-01-19 cs.LO cs.SE 57%

Applying Formal Methods Tools to an Electronic Warfare Codebase (Experience report)

将形式方法工具应用于电子战代码库(经验报告)

Letitia W. Li, Denley Lam, Vu Le, Daniel Mitchell, Mark J. Gerken, Robert B. Ross

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文报告了将形式方法工具应用于电子战系统中的经验,探讨了工具可用性及漏洞检测比较,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09921 2026-01-16 quant-ph cs.AI 57%

Learning to Decode in Parallel: Self-Coordinating Neural Network for Real-Time Quantum Error Correction

并行解码学习:用于实时量子错误校正的自协调神经网络

Kai Zhang, Zhengzhong Yi, Shaojun Guo, Linghang Kong, Situ Wang, Xiaoyu Zhan, Tan He, Weiping Lin, Tao Jiang, Dongxin Gao, Yiming Zhang, Fangming Liu, Fang Zhang, Zhengfeng Ji, Fusheng Chen, Jianxin Chen

机构 * Zhongguancun Laboratory(中关村实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文提出了一种自协调神经网络,用于实时量子错误校正,实现了高精度并行解码,突破了传统解码器的吞吐量瓶颈。

Comments The main text consists of 25 pages and 9 figures, extending our prior work (arXiv:2509.03815) with new results on surface code decoding in superconducting qubit systems and real-time performance benchmarks on TPU v6e

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23675 2026-01-15 cs.CR cs.AI 57%

QueryIPI: Query-agnostic Indirect Prompt Injection on Coding Agents

QueryIPI: 针对编码代理的查询无关间接提示注入

Yuchong Xie, Zesen Liu, Mingyu Luo, Zhixiang Zhang, Kaikai Zhang, Yuanyuan Yuan, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 QueryIPI通过利用系统不变性与工具描述,实现对编码代理的查询无关间接提示注入,实验显示其在模拟代理中达到87%的成功率,揭示了现实中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04124 2026-01-13 cs.SE 57%

Smells Depend on the Context: An Interview Study of Issue Tracking Problems and Smells in Practice

气味取决于上下文:关于问题跟踪问题和实践中气味的访谈研究

Lloyd Montgomery, Clara Lüders, Christian Rahe, Walid Maalej

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过访谈研究,探讨了问题跟踪系统中问题和气味的上下文依赖性,揭示了团队在实际工作中遇到的挑战及潜在的工具解决方案。

Comments 30 pages, 1 figure, accepted at the ACM TOSEM journal. arXiv admin note: substantial text overlap with arXiv:2507.06704

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03878 2026-01-08 cs.SE 57%

Understanding Specification-Driven Code Generation with LLMs: An Empirical Study Design

通过LLM理解基于规范的代码生成:一项实证研究设计

Giovanni Rosa, David Moreno-Lumbreras, Gregorio Robles, Jesús M. González-Barahona

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过实证研究设计,探讨人类干预在基于规范的LLM代码生成过程中对代码质量和动态的影响。

Comments This paper is a Stage 1 Registered Report. The study protocol and analysis plan were peer reviewed and accepted at SANER 2026 with a Continuity Acceptance (CA) score for Stage 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09280 2026-01-07 cs.DC cs.LG cs.NA math.NA 57%

TTrace: Lightweight Error Checking and Diagnosis for Distributed Training

TTrace: 轻量级的分布式训练错误检查与诊断

Haitian Jiang, Shaowei Zhu, Zhen Zhang, Zhenyu Song, Xinwei Fu, Zhen Jia, Yida Wang, Jinyang Li

机构 * New York University(纽约大学) Amazon Web Services(亚马逊网络服务)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 TTrace通过系统性的差分测试方法,有效检测和定位分布式训练中的无声bug,提升调试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01964 2026-01-06 cs.CL 57%

CSF: Contrastive Semantic Features for Direct Multilingual Sign Language Generation

CSF:对比语义特征用于直接多语言手语生成

Tran Sy Bao

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 CSF通过九个通用语义槽和综合条件分类法,实现无需英语中介的多语言手语直接生成,提升聋人社区的交流无障碍性。

Comments 9 pages, 8 tables, code available at https://github.com/transybao1393/csf-sign-language

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01850 2026-01-06 cs.LG cs.RO 57%

ManiBox: Enhancing Embodied Spatial Generalization via Scalable Simulation Data Generations

ManiBox: 通过可扩展的模拟数据生成增强具身空间泛化

Hengkai Tan, Xuezhou Xu, Chengyang Ying, Xinyi Mao, Zeyuan Wang, Songming Liu, Xingxing Zhang, Zhizhong Su, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Horizon Robotics

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 ManiBox通过可扩展的模拟数据生成提升具身智能体的空间泛化能力,有效减少仿真到现实的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00509 2026-01-05 cs.CR cs.LG 57%

Improving LLM-Assisted Secure Code Generation through Retrieval-Augmented-Generation and Multi-Tool Feedback

通过检索增强生成和多工具反馈改进LLM辅助的安全代码生成

Vidyut Sriram, Sawan Pandita, Achintya Lakshmanan, Aneesh Shamraj, Suman Saha

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 通过检索增强生成和多工具反馈,改进LLM辅助的安全代码生成,显著减少安全漏洞和缺陷率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22469 2025-12-30 cs.SE 57%

GraphLocator: Graph-guided Causal Reasoning for Issue Localization

GraphLocator: 图引导的因果推理用于问题定位

Wei Liu, Chao Peng, Pengfei Gao, Aofan Liu, Wei Zhang, Haiyan Zhao, Zhi Jin

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 GraphLocator通过因果图发现和动态解构解决软件问题定位中的因果不匹配和一对一不匹配问题,提升定位准确性和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21450 2025-12-29 cs.LG 57%

RLLaVA: An RL-central Framework for Language and Vision Assistants

RLLaVA: 一种面向语言和视觉助手的强化学习中心框架

Lei Zhao, Zihao Ma, Boyu Lin, Yuhe Liu, Wenjun Wu, Lei Huang

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与电子技术学院,人工智能研究院,北京航空航天大学,北京,中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG

AI总结 RLLaVA 提出了一种强化学习中心框架,通过解耦算法逻辑与模型架构,实现高效训练和多任务扩展,提升视觉-语言模型性能。

Comments The code is available at https://github.com/TinyLoopX/RLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21426 2025-12-29 cs.SE 57%

What Makes a GitHub Issue Ready for Copilot?

什么让 GitHub 问题适合 Copilot?

Mohammed Sayagh

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出32条准则,通过可解释机器学习模型评估GitHub问题质量,提升Copilot合并拉取请求的可能性,模型中位AUC达72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21878 2025-12-24 cs.SE cs.PL 57%

Advancing Automated In-Isolation Validation in Repository-Level Code Translation

在仓库级代码翻译中推进自动化独立验证

Kaiyao Ke, Ali Reza Ibrahimzada, Rangeet Pan, Saurabh Sinha, Reyhaneh Jabbarvand

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 TRAM通过结合上下文感知的类型解析与基于模拟的独立验证,实现了高质量的编程语言间翻译,尤其在Java到Python的翻译中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16965 2025-12-22 cs.CR cs.SE 57%

AutoDFBench 1.0: A Benchmarking Framework for Digital Forensic Tool Testing and Generated Code Evaluation

AutoDFBench 1.0:数字取证工具测试和生成代码评估的基准框架

Akila Wickramasekara, Tharusha Mihiranga, Aruna Withanage, Buddhima Weerasinghe, Frank Breitinger, John Sheppard, Mark Scanlon

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 AutoDFBench 1.0 提出了一种统一的自动化基准框架,用于评估数字取证工具、脚本及AI生成代码,通过标准化指标实现工具间的公平比较和可重复验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06890 2025-12-19 cs.LG stat.ML 57%

Learning-Driven Exploration for Reinforcement Learning

基于学习的探索用于强化学习

Muhammad Usama, Dong Eui Chang

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出基于熵的探索方法,通过自适应探索状态空间未探索区域,提升强化学习的效率和学习速度。

Journal ref 2021 21st International Conference on Control, Automation and Systems (ICCAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19972 2025-12-15 cs.RO cs.AI 57%

An effective control of large systems of active particles: An application to evacuation problem

大规模活性粒子系统的有效控制:应用于疏散问题的应用

Albina Klepach, Egor E. Nuzhin, Alexey A. Tsukanov, Nikolay V. Brilliantov

机构 * AIRI Artificial Intelligence Center, Skolkovo Institute of Science and Technology(人工智能中心,斯克洛夫科技研究所) Department of Mathematics, University of Leicester(数学系,莱斯特大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出一种结合强化学习与人工力的控制策略,用于机器人救援者高效疏散人群,克服了传统方法的可扩展性和鲁棒性不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03420 2025-12-12 cs.CR cs.SE 57%

HarnessAgent: Scaling Automatic Fuzzing Harness Construction with Tool-Augmented LLM Pipelines

HarnessAgent:利用工具增强的LLM流水线实现自动模糊测试Harness构建的扩展

Kang Yang, Yunhang Zhang, Zichuan Li, Guanhong Tao, Jun Xu, Xiaojing Liao

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 HarnessAgent通过工具增强的LLM流水线实现全自动、可扩展的模糊测试Harness构建,提升生成成功率和代码检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏