arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3244 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3244 篇

2511.07865 2026-02-09 cs.SE cs.AI cs.CL cs.MA 80%

LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost

基于大语言模型的完全自动化混沌工程:实现任何人以低成本构建容错软件系统

Daisuke Kikuta, Hiroki Ikeuchi, Kengo Tajiri

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 软件智能体 :planning(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出ChaosEater系统,利用大语言模型自动化混沌工程周期,使任何人能低成本构建容错软件系统。

Comments Accepted at ASE 2025 NIER Track. The code is available at https://github.com/ntt-dkiku/chaos-eater

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23045 2025-12-09 cs.AI cs.CL cs.SE 80%

Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents

Kimi-Dev:无代理训练作为SWE-代理的技能先验

Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu

机构 * Moonshot AI THU(清华大学) PKU(北京大学) UCAS(中国科学技术大学) BUPT(北京邮电大学) NUS(新加坡国立大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。

Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01010 2025-12-02 cs.MA cs.AI cs.LG cs.SE physics.comp-ph physics.flu-dyn 80%

Chain of Unit-Physics: A Primitive-Centric Approach to Scientific Code Synthesis

单元物理链:一种以基础原理为中心的科学代码合成方法

Vansh Sharma, Venkat Raman

机构 * University of Michigan(密歇根大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本研究提出单元物理链框架,通过以基础原理为中心的多代理系统,有效解决科学代码生成中的可靠性问题,实现高精度和高效能的代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12864 2025-10-16 cs.AI cs.CL cs.LG 80%

From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models

Imran Khan

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :AI agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 13 pages. Code and data are available at https://github.com/strongSoda/LITERAL-TO-LIBERAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15003 2025-07-22 cs.SE cs.AI cs.CE cs.LG 80%

The Rise of AI Teammates in Software Engineering (SE) 3.0: How Autonomous Coding Agents Are Reshaping Software Engineering

Hao Li, Haoxiang Zhang, Ahmed E. Hassan

机构 * Queen's University(女王大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00014 2025-07-02 cs.LG cs.AI cs.SE 80%

SWE-Bench-CL: Continual Learning for Coding Agents

Thomas Joshi, Shayan Chowdhury, Fatih Uysal

机构 * Columbia University(哥伦比亚大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20637 2026-08-24 cs.CR cs.AI 新提交 79%

ARQ: Agentic CodeQL Query Refinement for C/C++ Vulnerability Detection

ARQ:用于C/C++漏洞检测的智能CodeQL查询优化框架

Chunyi Wang, Yunfei Ke, Junfeng Yang, Yun-Yun Tsai, Penghui Li

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ARQ智能框架,利用合成C/C++程序的执行证据和LLM优化CodeQL查询,无需标注数据等,优化后查询的真阳性最多提升119.8%,还修复了长期悬而未决的问题并发现新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20342 2026-08-24 cs.AI cs.MA 新提交 79%

PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure

PrimeAgentOrchestrator:用于个人AI基础设施的内存初始化智能体生成器

Myron Koch (Peak Summit Labs)

机构 * Peak Summit Labs(峰汇实验室)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出PrimeAgentOrchestrator系统,生成预加载用户个人数据库相关记忆的Claude Code实例,并行查询两类记忆后端融合结果,管理智能体全生命周期,经四个月部署记录相关机制与工程权衡。

Comments 10 pages, 15 references, experience report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18565 2026-08-20 cs.SE 新提交 79%

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

SemaPLC:一种基于项目、经验证门控的PLC代码生成智能体框架

Yanlun Tu, Huacan Wang, Ziyue Zhou, Jie Zhou, Ningyan Zhu, Ge Chen, Wangyi Chen, Tengfei Zhou, Yifan Zhou, Dasheng Yang, Xiaofeng Mou, Hui Zhang, Yi Xu

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 SemaPLC是基于项目、经验证门控的PLC代码生成智能体框架,通过外部检查确认任务完成,在多模型的POU任务及项目上下文任务中均表现最优,动态行为测试得分显著高于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16934 2026-08-20 cs.AR cs.CL 版本更新 79%

SeqFeed: Improving Agentic RTL Code Generation with Sequential Behavior Feedback

SeqFeed:通过顺序行为反馈改进智能体RTL代码生成

Yuxin Du, Juxin Niu, Tao Hu, Xi Wang, Zhe Jiang, Nan Guan

专题命中 软件智能体 :agentic(title,abstract);分类 cs.CL

AI总结 针对智能体RTL代码生成的时序信息传递难题,本研究提出含SeQuery和SeGraph机制的SeqFeed,通过满足三项反馈要求提升LLM的RTL代码生成通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17504 2026-08-19 physics.comp-ph cs.SE 新提交 79%

Agentic Porting, Construction and Initial Verification and Validation of Libraries within the Open Source Unified TRAnsient Multi-Phase Advanced Reactor simulation Kit (Outram Park) Part I: Thermal Hydraulics

开源统一瞬态多相先进反应堆模拟工具包(Outram Park)中库的智能体迁移、构建及初步验证与确认 第一部分:热工水力

Theodore Kay Chen Ong, Ethan Yew Hoe Wong, Sicong Xiao

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 本研究将OpenFOAM库智能体迁移至Rust语言的Outram-Foam库,开发了两相HEM壅塞流求解器,验证显示其吻合度良好,智能体编码可提升开源库开发效率,人类专业知识仍为关键。

Comments 78 pages, 21 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14711 2026-08-18 cs.AI 新提交 79%

Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation

超越Pass@k:衡量智能体代码生成的可靠性与安全性

Jiajun Jiang, Sharon Zheng, Natan Vidra, Spurthi Setty

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Cornell University(康奈尔大学)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15572 2026-08-17 cs.LG cs.MA 版本更新 79%

Neural Network-Based Parameter Estimation of a Labour Market Agent-Based Model

基于神经网络的劳动力市场基于主体的模型参数估计

M Lopes Alves, Joel Dyer, Doyne Farmer, Michael Wooldridge, Anisoara Calinescu

机构 * Department of Computer Science(计算机科学系) Institute of New Economic Thinking(新经济思想研究所) University of Oxford(牛津大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.LG

AI总结 本文提出利用神经网络改进劳动力市场ABM参数估计方法,通过对比汇总统计量的有效性,验证了NN在参数恢复和效率提升方面的优势。

Comments Paper has been submitted without the consent of all 5 authors and without having its final version. Uploaded on arxiv at 17 Feb 2026 The version with proper review was only available on 19 March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 79%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.SE

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12123 2026-08-13 cs.DC cs.AI cs.OS 新提交 79%

Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control

就绪队列:在LLM智能体控制中限定GPU机会并避免主机往返

Josef Liyanjun Chen

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究针对LLM智能体控制,提出就绪队列边界的形式化方法,通过实验验证设备驻留路由决策路径可提升效率,为GPU智能体控制确立了两个可测量门限。

Comments 14 pages, 4 figures. Includes formal proofs, trace provenance, and a reproducibility appendix. Code and artifacts: https://github.com/josefchen/ready-cohorts ; processed evidence: https://huggingface.co/datasets/josefchen/ready-

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01687 2026-08-12 cs.AI 版本更新 79%

CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification

CoEvoSkills: 通过共进化验证实现自进化代理技能

Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue, Liu, Xiaoxiao Li, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 本文提出CoEvoSkills框架,使代理能自主生成复杂技能包,通过共进化验证提供反馈,实现在SkillsBench上最高通过率和强泛化能力。

Comments COLM accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09650 2026-08-11 cs.IR cs.CL 新提交 79%

Listwise Cross-Encoder Fine-Tuning vs. Agentic Instruction Tuning for LLM Rerankers: A Systematic Study in Medical Procedure Reranking

用于LLM重排序器的列表式交叉编码器微调与智能体指令微调:医疗流程重排序的系统性研究

Matan Fainzilber, Shlomit Plavner

专题命中 软件智能体 :agentic(title,abstract);分类 cs.CL

AI总结 本文系统性对比列表式交叉编码器微调与智能体指令微调两种LLM重排序范式,在自建医疗流程重排序数据集上,发现1.09亿参数的ListNet微调交叉编码器性能优于40亿参数的Qwen3-Reranker-4B,参数量仅为后者1/37,相关成果已开源。

Comments 10 pages, 6 figures, 4 tables. Code available at https://github.com/matanf-healthee/listwise-crossencoder-reranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08793 2026-08-11 cs.CL 新提交 79%

Evidence-Calibrated Runtime Reconstruction for Agent Skills Across Heterogeneous Coding Agents

面向异构编码智能体的技能的证据校准运行时重构

Xueping Gao

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL

AI总结 本文提出Skill Runtime Intelligence系统,针对异构编码智能体重构技能生命周期阶段,在多场景实验中验证其能准确定位失败边界,为适配器资格认定提供支撑。

Comments 17 pages, 1 figure, 6 tables. Submitted to PROFES 2026. Code and artifacts: https://github.com/hellogxp/skill-runtime-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18171 2026-08-11 cs.LG 版本更新 79%

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRT:用于引导智能体部署实时多模态应用的智能体框架

Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) AMD(超威半导体公司) University at Buffalo(纽约州立大学水牛城分校)

专题命中 软件智能体 :agent(title,abstract);分类 cs.LG

AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14166 2026-08-11 cs.SE cs.CR cs.DC 版本更新 79%

Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives

停止即停止:测量和修复智能体框架控制原语中的执行差距

Sajjad Khan

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究生产型大语言模型智能体框架控制原语执行差距,用无模型差分探针发现漏洞及差距,提出SOUNDGATE修复,能强制执行多种属性,端到端阻止违规,释放合法效果。

Comments 32 pages, 3 figures, 11 tables. Code: pip install soundgate (PyPI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29678 2026-08-10 cs.CL cs.DC cs.PF 版本更新 79%

TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

TokTier:面向智能体大语言模型服务的精确有状态分词方案

Zhenyu Zhang, Zhichao Cao

机构 * Arizona State University(亚利桑那州立大学)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.CL

AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。

Comments 26 pages. Code: https://github.com/asu-idi/toktier

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04440 2026-08-06 q-bio.QM cs.AI 交叉投稿 79%

AutoProteinEngine: A Large Language Model Driven Agent Framework for Multimodal AutoML in Protein Engineering

AutoProteinEngine:一种用于蛋白质工程多模态自动机器学习的大语言模型驱动智能体框架

Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 研究针对生物学家缺乏计算知识难以应用深度学习开展蛋白质工程的问题,提出AutoProteinEngine框架,集成LLMs与AutoML,经两项任务验证其性能优于传统方法,降低了深度学习应用门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00891 2026-08-04 cs.AI 新提交 79%

CADIR: A Cross-Backend Editable Intermediate Representation for Agentic CAD Generation

CADIR:一种用于智能体CAD生成的跨后端可编辑中间表示

Yu Liu, Jingzhe Ni, Yiming Chen, Junqi Huang, Ruofeng Tong, Min Tang, Peng Du

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本研究提出CADIR跨后端可编辑中间表示,结合几何签名匹配与构造图检索,解决现有CAD生成方法的跨系统编辑与建模历史保留问题,实验验证其几何保真度与可靠性优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00478 2026-08-04 cs.AI cs.HC 新提交 79%

Ekova: A Personality-Support Agent for Self-Discovery Dialogue

Ekova:用于自我发现对话的人格支持智能体

Yuyan Chen

机构 * ModelsLive Inc.(ModelsLive公司)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出人格支持范式,构建了DSD数据集、DeepSupport系统及Ekova智能体,经OrthoTune训练的模型在相关指标上较基线平均提升16.3%。

Comments Accepted to the COLM 2026 Lifelong Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06460 2026-08-04 cs.CR cs.AI 版本更新 79%

Will the Agent Recuse, and Will It Stop? Measuring LLM-Agent Compliance with In-Band Governance Signals at the Access Door and Mid-Flight

智能体会自行回避吗?测量LLM智能体对带内拒绝访问信号的遵从性

Thamilvendhan Munirathinam

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出一种轻量级带内拒绝信号(Recuse Signal),通过实验测量LLM智能体是否自愿遵从该信号,发现信号能有效诱导回避,但高级模型在操作员授权下可能忽略。

Comments v4: adds Experiment 4 (cross-vendor mid-task halt; measured harness-enforcement backstop). 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03618 2026-08-04 cs.AI 版本更新 79%

Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing

跨语言令牌套利:通过本地LLM预处理优化代码智能体上下文窗口

Mehmet Utku Colak

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出一种预处理的边缘端提示重写中间件,利用本地Llama 3.2模型进行跨语言翻译和结构重写,在保持或提升任务准确率的同时减少34-47%的提示令牌和最高18.8%的总令牌消耗。

Comments Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28928 2026-08-03 cs.SE 新提交 79%

Automated Testing and Repair for Verified Compilers Generated by a Coding Agent

基于编码智能体生成的验证编译器的自动化测试与修复

Martin Rinard

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 该研究针对编码智能体生成的验证编译器,提出了基于智能体的自动化测试与修复系统,经评估其在Axon编译器上无奖励黑客攻击问题,可有效开展测试与修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05131 2026-08-03 cs.CV cs.AI cs.RO 版本更新 79%

AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理

Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister

机构 * Southern University of Science and Technology(南方科技大学) Harvard University(哈佛大学) California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。

Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28027 2026-07-31 cs.MA cs.AI cs.CE 新提交 79%

VISA: A Structured Description Protocol for Agent-Based Simulation Models Towards Machine Reproducibility

VISA:面向智能体可复现性的智能体仿真模型结构化描述协议

Zhou He

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出VISA结构化描述协议,通过八个表格及可执行规则、LLM技能提升智能体模型可复现性,在三类平台的ABMs上验证了其有效性,将复现障碍转化为可处理的依赖项。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25560 2026-07-31 cs.AI 版本更新 79%

Agent Skills Matter: Inferring Proprietary Skills from Execution Trajectories

智能体技能很重要:从执行轨迹推断专有技能

Jianing Geng, Ruiqi He, Zekun Fei, Biao Yi, Xuansheng Wu, Ruijie Wang, Zheli Liu, Xia Hu, Qingkai Zeng

机构 * Nankai University(南开大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Alibaba Group(阿里巴巴集团) East China University of Science and Technology(华东理工大学) Beihang University(北京航空航天大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 研究从智能体执行轨迹推断专有技能的问题,提出SigLeak黑盒框架,利用技能特征构建诊断任务,通过对比轨迹迭代优化重构技能,在多场景和框架中表现出色,证明良性轨迹可暴露专有知识。

Comments 18 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏