arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3270 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3270 篇

2605.15601 2026-05-18 cs.SE quant-ph 57%

Bayesian Sequential Verification for Budget-Aware Quantum Program Testing

基于预算的量子程序测试的贝叶斯顺序验证

Lei Zhang

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出一种基于预算的量子程序测试方法,通过贝叶斯假设检验流程减少测量成本,适用于高成功概率的量子程序。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14859 2026-05-18 cs.CR cs.AI 57%

Do Coding Agents Understand Least-Privilege Authorization?

编码代理是否理解最小特权授权?

Zheng Yan, Jingxiang Weng, Charles Chen, Dengyun Peng, Ethan Qin, Jiannan Guan, Jinhao Liu, Qiming Yu, Yixin Yuan, Fanqing Meng, Carl Che, Mengkang Hu

机构 * Evolvent AI Research Team(Evolvent AI研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究编码代理是否能自主推断最小特权授权边界,提出Sufficiency-Tightness Decomposition方法,提升敏感任务成功率并降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01089 2026-05-18 cs.AI 57%

CodeDistiller: Automatically Generating Code Libraries for Scientific Coding Agents

CodeDistiller:自动为科学编码代理生成代码库

Peter Jansen, Samiah Hassan, Pragnya Narasimha

机构 * University of Arizona(亚利桑那大学) Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 CodeDistiller通过自动提炼科学GitHub仓库代码,生成经过验证的领域特定代码库,提升科学发现系统实验的准确性与完整性。

Comments 8 pages, 3 figures, 3 tables. Accepted to ACL 2026 (Demo Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21104 2026-05-15 cs.LG cs.PL 57%

BRIDGE: Building Representations In Domain Guided Program Synthesis

BRIDGE: 在领域引导的程序合成中构建表示

Robert Joseph George, Carson Eisenach, Udaya Ghai, Dominique Perrault-Joncas, Anima Anandkumar, Dean Foster

机构 * California Institute of Technology(加州理工学院) Amazon(亚马逊)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 BRIDGE通过多艺术ifacts程序合成框架提升Lean验证正确性,结合代码、规范和定理证明领域,提高生成效率和正确率。

Comments 41 pages, 10 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11186 2026-05-15 cs.MA cs.AI math.OC 57%

Sequential Resource Trading Using Comparison-Based Gradient Estimation

基于比较的梯度估计的顺序资源交易

Surya Murthy, Mustafa O. Karabag, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文研究了两个贪心理性代理在有限资源类别中进行顺序多议题交易的问题,提出基于比较的算法通过接受/拒绝反馈估计对方梯度,确保交易互惠并最终收敛到帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13740 2026-05-14 cs.LG 57%

Learning POMDP World Models from Observations with Language-Model Priors

从观测中学习POMDP世界模型:利用语言模型先验

Valentin Six, Frederik Panse, Mathis Fajeau, Lancelot Da Costa, Mridul Sharma, Alfonso Amayuelas, Tim Z. Xiao, David Hyland, Philipp Hennig, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) IRIIS University of California, Santa Barbara(加州大学圣芭芭拉分校) University of Tübingen(图宾根大学) University of Oxford(牛津大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出Pinductor,利用语言模型先验从少量观测-动作轨迹学习POMDP模型,实现高效世界模型学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13139 2026-05-14 cs.SE 57%

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle

SWE-Cycle:在完整问题解决周期中对齐代码代理的基准测试

Hao Guan, Lingyue Fu, Shao Zhang, Yaoming Zhu, Kangning Zhang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zhang, Yong Yu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出SWE-Cycle基准测试,评估代码代理在环境重建、代码实现和测试生成等任务中的能力,揭示了在端到端任务中处理跨阶段依赖和保持代码质量的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 57%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08017 2026-05-14 cs.SE 57%

Collaborator or Assistant? How AI Coding Agents Partition Work Across Pull Request Lifecycles

合作者还是助手?AI编码代理如何在拉取请求生命周期中分配工作

Young Jo, Chung, Safwat Hassan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究AI编码代理在拉取请求生命周期中如何分配工作,通过分析工具的协作-助手光谱,探讨操作权与合并治理的分离,提出分类学、状态机和可重复实验包。

Comments 10 pages, 8 figures, AIWare 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12366 2026-05-13 cs.AI 57%

Classifier Context Rot: Monitor Performance Degrades with Context Length

分类器上下文旋转:通过上下文长度监控性能退化

Sam Martin, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic fellows项目)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12275 2026-05-13 cs.SE cs.PL 57%

Minimalistic Terminal Editor for Julia Programming -- MinTEJ: A Friendly Approach for a Scientific Programmer

为Julia编程语言设计的极简终端编辑器--MinTEJ:面向科学程序员的友好方法

Poornachandratejasvi Laxman Bhattar, Payal V. Dahiwale, Krishnarjunulu Thota, Anurag Sharma

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出MinTEJ,一种基于终端的Julia编辑器,采用顺序模式交互架构,整合文件管理、代码编辑、执行和调试,降低认知负荷和错误率。

Comments 15 Pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI 57%

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10500 2026-05-12 cs.AI 57%

SkillEvolver: Skill Learning as a Meta-Skill

SkillEvolver: 技能学习作为元技能

Genrui Zhang, Erle Zhu, Jinfeng Zhou, Caiyan Jia, Hongning Wang

机构 * Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 SkillEvolver通过元技能迭代生成、部署和优化领域特定技能,无需重新训练即可直接应用于任何智能体,其学习目标是技能的文本和代码而非模型权重,通过元技能自身作为技能加载,提升技能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07237 2026-05-12 cs.CL 57%

Teaching Language Models to Think in Code

教语言模型用代码思考

Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN科技)

专题命中 软件智能体 :planning(abstract);分类 cs.CL

AI总结 本文提出ThinC框架,通过代码自身进行推理而非依赖自然语言,提升了数学问题解决能力,其在多个基准测试中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08621 2026-05-12 cs.SE 57%

EvidenT: An Evidence-Preserving Framework for Iterative System-Level Package Repair

EvidenT: 一个证据保留的系统级包修复框架

Chenyu Zhao, Minghua Ma, Shenglin Zhang, Zeshun Huang, Yongqian Sun, Chetan Bansal, Saravan Rajmohan, Dan Pei

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出EvidenT框架,通过证据管理与工具执行解耦,解决系统级包修复中的依赖和环境配置问题,实验显示其在RISC-V包修复中表现优异,且在不同架构上具有良好的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02175 2026-05-12 cs.AI 57%

Intervention Complexity as a Canonical Reward and a Measure of Intelligence

干预复杂性作为规范奖励和智能的度量

Brendan McCane

机构 * School of Computing University of Otago(计算学院奥塔哥大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出干预复杂性作为智能的规范度量,具有环境衍生性、普遍性、最小性、敏感性和成就偏好等性质,通过资源函数定义通用奖励,并探讨智能的双维度表征及计算可性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08382 2026-05-12 cs.CR cs.CL cs.CY 57%

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07769 2026-05-11 cs.SE 57%

Coding Agents Don't Know When to Act

编码代理不知何时行动

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究发现当前编码代理在处理过时bug报告时频繁错误修改代码,提出需显式引导无行动以避免技术债务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06125 2026-05-08 cs.SE 57%

Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution

打破、过时或缺失?基于项目级测试演变的基准测试

Ye Shang, Quanjun Zhang, Haichuan Hu, Chunrong Fang, Liang Xiao, Zhenyu Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出TEBenchmark,首个项目级测试演变基准,评估系统自主识别需修改的测试、确定新测试需求并生成测试补丁的能力,揭示测试演变任务的性能上限。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05980 2026-05-08 cs.AI 57%

TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering

TACT: 通过激活引导缓解编码代理中的过度思考与过度行动

Yuan Sui, Yulin Chen, Yibo Li, Xue Jiang, Yufei He, Yihong Dong, Xiaoxin He, Tianyu Gao, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Meta

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出TACT方法,通过激活引导检测并缓解编码代理中的过度思考和过度行动问题,提升任务解决效率和准确性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08915 2026-05-08 cs.SE 57%

Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance

比较AI编码代理:一项任务分层的拉取请求接受分析

Giovanni Pinna, Jingzhi Gong, David Williams, Federica Sarro

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文通过分析7156个拉取请求,比较了五个AI编码代理在不同任务类型上的接受率差异,发现文档任务接受率显著高于新功能任务,且OpenAI Codex在多种任务类型中表现优异。

Comments Accepted by MSR'26 Mining Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05258 2026-05-08 cs.SE 57%

PARNESS: A Paper Harness for End-to-End Automated Scientific Research with Dynamic Workflows, Full-Text Indexing, and Cross-Run Knowledge Accumulation

PARNESS:一种用于端到端自动化科学研究的论文工具,支持动态工作流、全文索引和跨运行知识积累

Yuchen Wang, Zhongzhi Luan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 PARNESS通过动态工作流、全文索引和跨运行知识积累,解决传统科研系统流程僵化、知识累积不足的问题,实现端到端自动化科研。

Comments 31 pages, 13 figures, includes appendix with a verbatim end-to-end-generated paper produced by the framework. Source: https://github.com/gtrhythm/PARNESS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10652 2026-05-04 cs.HC cs.AI cs.CY cs.ET 57%

Vibe Coding in Product Teams: Reconfiguring AI-Assisted Workflows, Prototyping, and Collaboration

产品团队中的Vibe编码:重新配置AI辅助的工作流、原型设计与协作

Jie Li, Youyang Hou, Laura Lin, Ruihao Zhu, Hancheng Cao, Abdallah El Ali

机构 * Netherlands and MIT Media Lab(荷兰和MIT媒体实验室) Notion Labs(Notion实验室) Collov AI Cornell University(康奈尔大学) Goizueta Business School, Emory University(埃默里大学戈伊兹埃塔商学院) Centrum Wiskunde & Informatica, The Netherlands and Utrecht University, The Netherlands(荷兰代尔夫特理工大学和乌得勒支大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文研究Vibe编码如何重塑产品开发流程与协作,揭示其四阶段工作流及带来的效率与创造力提升,同时指出代码不可靠、集成困难等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27148 2026-05-01 cs.SE 57%

CI-Repair-Bench: A Repository-Aware Benchmark for Automated Patch Validation via CI Workflows

CI-Repair-Bench:基于CI工作流的自动化补丁验证仓库意识基准

Rabeya Khatun Muna, Md Nakhla Rafi, Tse-Hsun, Chen

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 CI-Repair-Bench通过真实GitHub Actions执行构建,提供仓库级程序修复基准,包含567个CI失败实例,细粒度评估12种CI错误类型,揭示自动化修复在局部和工具强制失败上效果最佳,但环境依赖等问题仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26892 2026-04-30 cs.SE 57%

Hot Fixing in the Wild

野火修复

Carol Hanna, Karine Even-Mendoza, W. B. Langdon, Mar Zamorano López, Justyna Petke, Federica Sarro

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究分析了61000余个仓库中的人工和AI代理生成的热修复,发现其具有紧迫性特征,揭示了人类与AI在修复行为上的差异,为实际应用中的热修复协作提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11295 2026-04-30 cs.CL 57%

The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences

提示工程报告精简:生命科学领域的快速入门指南

Valentin Romanov, Steven A Niederer

机构 * National Heart & Lung Institute, Faculty of Medicine, Imperial College London(英国伦敦帝国学院医学院国家心脏和肺研究所)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 本文总结了生命科学领域中6种核心提示工程技巧,包括零样本、少样本、思考生成等,旨在提升LLM在文献总结、数据提取等任务中的效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26591 2026-04-30 cs.CE cs.AI 57%

MappingEvolve: LLM-Driven Code Evolution for Technology Mapping

MappingEvolve:基于大语言模型的科技映射代码进化

Rongliang Fu, Yi Liu, Qiang Xu, Tsung-Yi Ho

机构 * Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出MappingEvolve框架,利用大语言模型直接进化科技映射代码,通过分层代理架构提升代码优化效果,实验显示在面积减少和延迟平衡方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04486 2026-04-29 quant-ph cond-mat.dis-nn cs.CC cs.IT cs.LG math.IT 57%

Quantum circuit complexity and unsupervised machine learning of topological order

量子电路复杂性与拓扑序的无监督机器学习

Yanming Che, Clemens Gneiting, Xiaoguang Wang, Franco Nori

机构 * Department of Physics, University of Michigan, Ann Arbor, Michigan 48109-1040, USA(密歇根大学物理系,安娜堡,密歇根州,48109-1040,美国) Center for Quantum Computing, RIKEN, Wako-shi, Saitama 351-0198, Japan(日本理化学研究所量子计算中心,武藏野市,埼玉县,351-0198,日本) Department of Physics, Zhejiang Sci-Tech University, Hangzhou 310018, China(浙江科技学院物理系,杭州310018,中国)

专题命中 软件智能体 :planning(abstract);分类 cs.LG

AI总结 本文探讨量子电路复杂性作为理解拓扑序无监督机器学习的工具,提出两个定理连接量子路径规划与量子鱼跃复杂度及纠缠生成,展示了基于保真度和纠缠度的相似性度量在量子相变研究中的优越性能。

Comments Updated version; With enriched Supplementary Information; 23 pages; 5 figures. Code is available upon reasonable request, and will be open-sourced along with the publication. Comments are welcome

Journal ref Nature Communications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25369 2026-04-29 cs.AI 57%

Multi-action Tangled Program Graphs for Multi-task Reinforcement Learning with Continuous Control

多动作纠缠程序图用于具有连续控制的多任务强化学习

Quentin Vacher, Nicolas Beuve, Mickaël Dardaillon, Karol Desnos

机构 * Univ Rennes, INSA Rennes, CNRS, IETR – UMR 6164(里昂大学、里昂国家高等工业学院、国家科学研究中心、IETR – UMR 6164)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出多动作纠缠程序图(MATPG)用于连续多任务强化学习,通过整合MAPLE代理并创建控制流,证明其在多任务场景下的优越性,并展示其可解释性。

Journal ref EuroGP 2026, Apr 2026, Toulouse, France. pp. 259-274

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18445 2026-04-29 cs.LG cs.AR 57%

AutoPPA: Automated Circuit PPA Optimization via Contrastive Code-based Rule Library Learning

AutoPPA:通过对比代码基于的规则库学习实现自动电路PPA优化

Chongxiao Li, Pengwei Jin, Di Huang, Guangrun Sun, Husheng Han, Jianan Mu, Xinyao Zheng, Jiaguo Zhu, Shuyi Xing, Hanjun Wei, Tianyun Ma, Shuyao Cheng, Rui Zhang, Ying Wang, Zidong Du, Qi Guo, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所处理器重点实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) University of Science and Technology of China, Hefei, China(中国科学技术大学,合肥,中国) Institute of AI for Industries, Chinese Academy of Sciences, Nanjing, China(中国科学院工业人工智能研究所,南京,中国)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 本文提出AutoPPA框架,通过对比生成的代码对自动生成优化规则,提升RTL设计中PPA优化效率,实验表明优于手动优化和现有方法SymRTLO和RTLRewriter。

详情

展开后加载摘要…

URL PDF HTML 收藏