arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12148 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 1096 篇

2002.11197 2020-02-27 cs.AI cs.LG 62%

Behavior Cloning in OpenAI using Case Based Reasoning

Chad Peters, Babak Esfandiari, Mohamad Zalat, Robert West

专题命中 软件智能体 :software agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.02037 2019-10-03 cs.LG cs.AI stat.ML 62%

TFLMS: Large Model Support in TensorFlow by Graph Rewriting

Tung D. Le, Haruki Imai, Yasushi Negishi, Kiyokuni Kawachiya

专题命中 软件智能体 :repository(abstract);分类 cs.AI、cs.LG

Comments A new version of TFLMS was published at ISMM 2019 (https://dl.acm.org/citation.cfm?id=3329984)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.02068 2019-06-06 cs.SE cs.AI cs.PF 62%

Architectural Middleware that Supports Building High-performance, Scalable, Ubiquitous, Intelligent Personal Assistants

Oscar J. Romero

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.08289 2019-01-23 cs.AI cs.CY cs.HC cs.LG cs.RO 62%

Mammalian Value Systems

Gopal P. Sarma, Nick J. Hay

专题命中 软件智能体 :software agent(abstract);分类 cs.AI、cs.LG

Comments 12 pages

Journal ref Informatica Vol. 41 No. 3 (2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.05092 2018-04-17 cs.LG cs.AI stat.ML 62%

A new robust feature selection method using variance-based sensitivity analysis

Saman Sadeghyan

专题命中 软件智能体 :repository(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15678 2026-08-18 cs.SE 新提交 57%

Where Accountability Lives: Mapping Human Responsibility to Workflow Artifacts in Agentic Software Development

责任归属:在智能体软件开发中将人类责任映射到工作流制品

Sabry E. Farrag

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 该研究分析智能体软件开发中责任归属的矛盾,替换验证分类法,发现责任归属方向相反,指出智能体工具未造成责任差距,相关数据已公开。

Comments 30 pages, 5 tables. Source collection of 118 archived documents and 12 processing scripts deposited at Zenodo, doi:10.5281/zenodo.21965182

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14490 2026-08-17 cs.AI 新提交 57%

Twin: Playing an Unknown Game with a Test-Time Digital Twin

Twin:利用测试时数字孪生玩未知游戏

Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。

Comments Project website with action-by-action replays of all 25 runs: https://arc-agi-3-twin.vercel.app/ Code: AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12161 2026-08-14 cs.CL 版本更新 57%

Token Reduction Is Not Cost Reduction

令牌减少并非成本降低

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 57%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11772 2026-08-13 cs.CL 新提交 57%

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

修复前诊断:将智能体故障转化为选择性自修正

Pan Wang, Yihao Hu, Hang Wang, Zirui Lv, Xin Zhang, Jianshe Li, Jiang-Ming Yang, Wei Wu, Yongqi Tong

机构 * Ant International(蚂蚁国际)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本研究提出诊断引导的修复框架DARC,通过先诊断故障类型再进行选择性自修正,在ALFWorld等三个任务场景中提升了智能体平均任务性能并减少资源消耗,为缺乏类编译器反馈的领域构建可靠智能体提供了实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 57%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11340 2026-08-13 cs.NI cs.AI 新提交 57%

Self-evolving network verifiers

自演进网络验证器

Ioannis Protogeros, Tibor Schneider, Laurent Vanbever

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出一种自动演进的网络验证器,通过编码智能体与可信预言机的反例引导循环,让基于SMT的验证器自主学习新网络功能,解决手动维护模型的难题。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02815 2026-08-12 cs.CL 版本更新 57%

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

FlexSQL:灵活探索与执行打造更优的文本到SQL智能体

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10504 2026-08-12 cs.AI 新提交 57%

MEGA: Self-Evolving Agent Optimization Infrastructure via Wisdom Graph

MEGA:基于智慧图的自进化智能体优化基础设施

Jung Hwan Lee, Kyu Ho Lee, Gwang Hoon Yoo

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 MEGA是一种自进化智能体优化基础设施,通过三层架构实现智慧积累、组合推理与自进化,可系统性优化异构智能体系统,将优化与知识进化融为一体。

Comments 29 pages, 10 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10178 2026-08-12 cs.SE 新提交 57%

One Recipe, Many Harnesses: What Self-Evolution Encodes Across Languages and Models

一个方案,多种适配:自演化在不同语言和模型中编码了什么

Siqi Yang, Qianlan Yang, Yu-Xiong Wang, Saurabh Pujar, Martin Hirzel

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 该研究固定演化方案,在八种编程语言和三个基础模型上分析自演化适配工具,发现其为语言需求与模型差距共同塑造的补偿层,可提升编码智能体性能并能蒸馏为通用工具。

Comments 20 pages, 12 figures, 9 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10157 2026-08-12 cs.AI 新提交 57%

SBCO: Self-Supervised, Verifier-Grounded Harness Optimization For Planning Agents

SBCO:面向规划智能体的自监督、验证器驱动的工具链优化器

Vivek Kulkarni, Sudipta Paul, Aounon Kumar, Nicholas Tzou, Srinivas Chappidi

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本研究针对规划任务提出SBCO,一种自监督的验证器驱动工具链优化器,其性能优于或相当的定制基线,且计算成本仅为其1/4至1/5.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09290 2026-08-12 cs.SE 版本更新 57%

OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review

OpenCodeReview:面向成本效益型智能体代码评审的非确定性转确定性方案

Zhengfeng Li, Lei Zhang, Xianwei Wu, Zhengqi Zhuang, Yingjie Xu, Boge Wang, Shaofei Zhu, Chuan Wang, Peng Zhao, Xinyu Zheng, Guoping Rong

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 OpenCodeReview针对LLM代码评审智能体的非确定性与上下文局部性缺陷,通过在三个流水线节点注入确定性,在AACR-Bench上实现SEM-F1提升且大幅降低令牌消耗,性能优于主流编码智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07925 2026-08-11 cs.AI 新提交 57%

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写

Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li

机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07885 2026-08-11 cs.AI 新提交 57%

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

广泛推理,而非深度推理:将推理溢价分摊到提炼技能中

Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出将推理模式的重复分摊为跨任务提炼的技能,在四个智能体基准上大幅降低代币量的同时恢复多数推理性能,部分场景下优于推理模式。

Comments COLM 2026 Efficient Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27380 2026-08-11 cs.CV cs.AI 版本更新 57%

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法

Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

机构 * CUHK(香港中文大学) USTC(中国科学技术大学) SCUT(华南理工大学) HKU(香港大学) NTU(南洋理工大学) PKU(北京大学) SJTU(上海交通大学) CMU(卡内基梅隆大学) THU(清华大学) HUST(华中科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。

Comments 15 pages, 3 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18171 2026-08-11 cs.LG 版本更新 57%

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRT:用于引导智能体部署实时多模态应用的智能体框架

Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) AMD(超威半导体公司) University at Buffalo(纽约州立大学水牛城分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29678 2026-08-10 cs.CL cs.DC cs.PF 版本更新 57%

TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

TokTier:面向智能体大语言模型服务的精确有状态分词方案

Zhenyu Zhang, Zhichao Cao

机构 * Arizona State University(亚利桑那州立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。

Comments 26 pages. Code: https://github.com/asu-idi/toktier

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02986 2026-08-05 cs.CR cs.AI cs.MA 新提交 57%

Internalising the Identity Primitive: Cryptographic Individuality for an Autonomous Agent on a Public Blockchain

内化身份基元:公有区块链上自主智能体的密码学个体性

Keisuke Suzuki

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 本文提出将公有区块链上自主智能体的身份密钥-权重绑定信任根转移至密码学假设,在Solana开发网部署了首个身份基元为密码学不变量的链上智能体,完成了2.36天链上运行,实例化了密码学个体性。

Comments 52 pages, 3 figures, 11 tables. Cryptographic key-to-weights binding (W = HKDF(sk) inside Groth16) with an on-chain state-commitment chain on Solana devnet; active-query, homeostatic, and economic-metabolism extensions; 166- and 168-cycle continuous runs. Code, threat model, and per-cycle telemetry: https://github.com/ksk-S/internalising-identity-2026 (tag arxiv-v1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02693 2026-08-05 cs.SE cs.CR 新提交 57%

PRWeaver: Evaluating LLM-Based Code Auditors against Long-Horizon Malicious Pull Requests

PRWeaver:针对基于大语言模型的代码审计工具对抗长周期恶意拉取请求的评估

Yuekun Wang, Mingfei Cheng, Xiaofei Xie

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 该研究提出PRWeaver基准,评估基于LLM的代码审计工具对长周期恶意PR的可靠性,发现特定评审策略会降低检测率,为优化代码审计工具提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11589 2026-08-05 cs.SE 57%

A Study of Library Usage in Agent-Authored Pull Requests

对代理生成的拉取请求中图书馆使用情况的研究

Lukas Twist, Jie M. Zhang

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究探讨了代理生成的拉取请求中图书馆使用情况,发现代理频繁导入图书馆但很少引入新依赖项,且在引入时遵循严格的版本控制实践。

Comments 5 pages, 3 tables. Accepted at MSR '26 (Challenge Track)

Journal ref 23rd International Conference on Mining Software Repositories: MSR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03618 2026-08-04 cs.AI 版本更新 57%

Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing

跨语言令牌套利:通过本地LLM预处理优化代码智能体上下文窗口

Mehmet Utku Colak

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种预处理的边缘端提示重写中间件,利用本地Llama 3.2模型进行跨语言翻译和结构重写,在保持或提升任务准确率的同时减少34-47%的提示令牌和最高18.8%的总令牌消耗。

Comments Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24600 2026-08-04 cs.AI 版本更新 57%

Agent-as-Peer-Debriefer: A Multi-Agent Framework with Perspective-Based Refinement for Qualitative Analysis

Agent-as-Peer-Debriefer: 一种基于视角精炼的多智能体定性分析框架

Zhimin Lin, Kun Cheng, Zhiyao Shu, Junhua Fang, Juntao Li, Fan Bai, Jie Gao

机构 * Soochow University(苏州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种多智能体框架,通过模拟同行汇报(peer debriefing)并引入理论驱动、数据驱动和应用三种分析视角,提升大语言模型在定性数据分析中的编码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28825 2026-08-03 cs.SE 新提交 57%

Building a Process-Modeling Tool using Agentic AI: An Experience Report on PM4Py-UCM

使用智能体AI构建流程建模工具:PM4Py-UCM的经验报告

Daniel Amyot

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文通过AI辅助构建开源流程建模工具PM4Py-UCM的深入案例,提出相关工具包与分类法,总结了开发经验教训及验证策略。

Comments 17 pages, 9 figures, 4 tables, submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21997 2026-07-31 cs.SE 版本更新 57%

"Go Home Copilot, You're Drunk": Understanding Developer Responses to Agent-Generated Code Review Comments

“回家吧,副驾驶,你喝醉了”:理解开发者对智能体生成的代码审查评论的回应

Shamse Tasnim Cynthia, Ratnadira Widyasari, Banani Roy, Ting Zhang, David Lo

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究开发者对智能体生成的代码审查评论的回应,分析五个智能体在342个Python仓库生成的54791条评论,探讨解决率、开发者经验及影响评论有用性的特征,发现不同智能体解决率有差异,还确定未解决评论原因及影响因素,为改进相关反馈提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25890 2026-07-29 cs.AI 新提交 57%

Distributing Security Controls Through Harness Engineering

通过工具工程分发安全控制

William Robert Gore

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究商业AI编码代理安全控制分发问题,通过分阶段测试方法,利用SHarD工具在多种代理配置上测试,证明三类安全控制可通过单个命令嵌入分发,效果与直接安装商业代理相同,还提出相关框架特征及后续研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏