arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-17 至 2026-08-17 共收录 25 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 10 篇

2509.24148 2026-08-17 cs.SE cs.AI 版本更新 88%

TENET: One Step Toward Test-Driven Development for Repository-Level Code Generation

TENET:迈向仓库级代码生成的测试驱动开发的第一步

Yiran Hu, Shanchao Liang, Nan Jiang, Yi Wu, Lin Tan

机构 * Purdue University(普渡大学) Microsoft Office AI(微软办公人工智能)

专题命中 代码生成 :code generation(title,abstract);repository(title,abstract);分类 cs.SE、cs.AI

AI总结 研究仓库级代码生成的测试驱动开发问题,提出TENET框架,含测试harness机制、定制工具集和细化工作流程,能选简洁测试套件,实现高效检索调试与迭代改进,性能优于基线,还研究了测试套件特征对LLM代理性能的影响。

Comments Accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13742 2026-08-17 cs.SE cs.AI cs.LG 新提交 82%

Does ISO-Grounded NFR Specification Improve LLM Code Generation? A Comparison of Rich and Structured Interventions against a Natural-Language Baseline

基于ISO标准的非功能性需求(NFR)规范是否能提升大语言模型(LLM)的代码生成能力?针对丰富干预方式、结构化干预方式与自然语言基线的对比研究

Joào Pedro Monteiro Pereira, Vinicius Cardoso Garcia

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 该研究对比了ISO标准下丰富自然语言、结构化JSON与单行基线三种NFR规范对LLM代码生成的影响,发现前者可提升代码静态质量,且语义内容比格式更重要。

Comments 11 pages, 2 figures, Accepted for publication at the 20th Brazilian Symposium on Software Components, Architectures, and Reuse (SBCARS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13900 2026-08-17 cs.DB cs.AI cs.CL cs.LG 新提交 67%

Agentic Transaction: Towards ACID-Compliant Agent Systems

智能体事务:面向ACID兼容的智能体系统

Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13607 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

没有通用信号可预测版本更新下的样本级大语言模型退化

Jia Sheng, Yiwei Lu

机构 * University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何用推理时信号预测LLM版本更新导致的样本级退化,对比单模型与跨版本信号,发现信号有效性具任务依赖性且无通用最优信号,部分跨版本信号可支持选择性回退,从业者可据此选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13596 2026-08-17 cs.LG cs.AI 新提交 62%

Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

通过激活引导剪枝实现跨模型规模的无训练知识迁移

Jiahe Fan, Si Chen, Yinghao Hou, Aiyuan Zhang, Hong Xie

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。

Comments 9 pages, 3 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21339 2026-08-17 cs.SE cs.PL 版本更新 62%

KBSpec: LLM-driven Formal Specification Generation with Evolving Domain Knowledge Base

KBSpec:基于演化领域知识库的LLM驱动形式化规约生成

Wenhan Wang, Zeyu Sun

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 提出KBSpec方法,利用外部官方文档和内部验证器反馈的双源知识增强LLM,通过自演化知识库持续更新成功轨迹,无需调参或标注数据,在JML规约生成上验证通过率提升10-25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14303 2026-08-17 cs.LG 新提交 57%

Detecting Contaminated Code-Generation Prompt Batches via Influence Functions

利用影响函数检测受污染的代码生成提示批次

Francesco Quinzan, Noor Munir, Yishun Lu, Stephen Roberts

机构 * The University of Oxford(牛津大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出与威胁模型无关的CodeSIFT方法,利用影响函数检测受污染的代码生成提示批次,在3B至7B参数的三个代码LLM上,中高注入率下AUROC达0.98,性能优于静态分析基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10492 2026-08-17 cs.AI cs.CY 版本更新 57%

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

洞察学生的思维:在LLM学生模拟器中联合建模潜在推理与行动

Rose Niousha, Minwoo Kang, Narges Norouzi

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究针对LLM学生模拟器仅复现学生行动却未捕捉其潜在推理的问题,提出INSIDE框架,通过在配对思考轨迹与行动上微调LLM,提升了模拟行动保真度与推理对齐度,最高对齐度达57.9%。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08444 2026-08-17 cs.SE 版本更新 57%

When LLMs Invent Rust Crates: An Empirical Study of Hallucination Patterns and Mitigation

当LLM发明Rust包:幻觉模式与缓解措施的实证研究

Jieming Zheng, Hao Guan, Yepang Liu

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究首次大规模实证分析LLM生成Rust代码中的包幻觉问题,发现不同模型幻觉率惊人一致且对参数不敏感,并探索了提示工程缓解策略。

Comments The work has been accepted by the 17th International Conference on Internetware

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11629 2026-08-17 cs.CR cs.LG 版本更新 57%

Semantic Differentiation for Tackling Challenges in Watermarking Low-Entropy Constrained Generation Outputs

语义分化用于解决水印标记低熵约束生成输出的挑战

Nghia T. Le, Alan Ritter, Kartik Goyal

机构 * School of Interactive Computing(交互计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 SeqMark通过语义分化解决低熵约束生成任务中水印标记的挑战,提升检测准确率并保持生成质量。

Comments 23 pages, 5 figures, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2608.13867 2026-08-17 cs.SE cs.AI 新提交 82%

Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

构建可靠的编码智能体:评估与运行模型周边系统

Stephanie Jarmak

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本研究针对AI编码智能体的可靠性问题,整合多源证据构建系统级评估与运行框架,区分模型与基础设施效应,提出可靠性记录目录及相关方法以提升智能体系统可靠性。

Comments Technical review and engineering monograph, 314 pages, 30 figures. Includes an evidence audit, a companion research artifact with 206 reliability records, and runnable protocols for evaluating and operating AI coding agents. August 2026. Source, companion, and reusable protocols: https://github.com/sjarmak/engineering-reliable-coding-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13568 2026-08-17 cs.CL cs.AI 新提交 81%

Does a Language Server Save Tokens for Coding Agents? A Measurement Methodology and Preliminary Study

语言服务器能为编码智能体节省 token 吗?一种测量方法与初步研究

Pengcheng Xu

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过五组消融实验等方法,对比 LSP 与 grep 检索的 token 效率,发现 LSP 通常不节省 token,仅对最弱模型有 token 节省效果,需根据任务、模型等选择检索工具。

Comments 13 pages, 6 figures. Code and data: https://github.com/Poytr1/lsp-vs-grep-token-study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29516 2026-08-17 cs.SE cs.AI 版本更新 62%

From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale

从代码审查到代码批判:大规模AI生成代码差异的意图、漂移与焦点

Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. Rigby

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 针对AI生成代码超出传统审查能力且现有工具忽视核心问题的缺陷,提出ARCTIC系统,经实验验证其在意图预测、漂移检测等方面表现优异,可降低代码不一致性并获高认可。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06737 2026-08-17 cs.SE cs.AI 62%

A Self-Healing Framework for Reliable LLM-Based Autonomous Agents

基于大语言模型的自主代理的自修复框架

Cheonsu Jeong, Younggun Shin

机构 * AX Center, SAMSUNG SDS(三星SDS AX中心) Dept. of Artificial Intelligence, Graduate School of Engineering, Yonsei University(延世大学工程研究生院人工智能系)

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一种可靠性感知的自修复框架,通过故障检测、可靠性评估和自动恢复机制提升基于大语言模型的自主代理的可靠性,实验表明该方法显著提高了任务成功率并增强了系统鲁棒性。

Comments 13 pages, 3 figures,1 table

Journal ref International Journal of Software Engineering and Knowledge Engineering,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14490 2026-08-17 cs.AI 新提交 57%

Twin: Playing an Unknown Game with a Test-Time Digital Twin

Twin:利用测试时数字孪生玩未知游戏

Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。

Comments Project website with action-by-action replays of all 25 runs: https://arc-agi-3-twin.vercel.app/ Code: AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14093 2026-08-17 cs.HC 新提交 50%

AppLooper: An Agentic Application Engineering Loop for Accountable Release with Virtual-User Feedback

AppLooper:用于负责任发布的智能体应用工程闭环,结合虚拟用户反馈

Zihong He, Chen Liang, Hai-Ning Liang

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文提出AppLooper,一种结合虚拟用户反馈的人-编码智能体-虚拟用户应用工程闭环,将开发各环节绑定至特定版本,实现可追踪的负责任发布,人类保留最终发布权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13536 2026-08-17 cs.OS 版本更新 50%

Don't Let AI Agents YOLO Your Files: Information and Control in Agent-Native Filesystems

别让AI代理占用你的文件:将信息和控制移交给文件系统以实现代理安全和自主性

Shawn Wanxiang Zhong, Junxuan Liao, Jing Liu, Mai Zheng, Andrea C. Arpaci-Dusseau, Remzi H. Arpaci-Dusseau

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文研究了AI代理对文件系统的滥用问题,提出YoloFS文件系统通过三种技术提升代理的安全性和自主性,减少用户交互并提高任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2608.13610 2026-08-17 eess.IV cs.MM 新提交 50%

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

LoopVSR:用于自动修复视觉语音识别推理流水线的循环工程框架

Fei Qin, Bowen Zhang, Chao Fan, Pengcheng Luo, Genke Yang

专题命中 程序修复 :repository(abstract)

AI总结 LoopVSR是一种循环工程框架,可让代码智能体结合端到端执行证据自动修复VSR推理流水线,在CMLR VSR系统上的表现远优于静态防护,可实现100%平均修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2608.13928 2026-08-17 cs.CR cs.SE 新提交 57%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14660 2026-08-17 quant-ph 版本更新 50%

Heuristic and Optimal Synthesis of CNOT and Clifford Circuits

CNOT与Clifford电路的启发式及最优综合

Mark Webster, Stergios Koutsioumpas, Dan E Browne

专题命中 代码评测 :repository(abstract)

AI总结 本研究针对CNOT与Clifford电路,提出最优、A*及贪心三类综合算法,可最小化两量子比特门数量或电路深度,经基准测试性能优于现有方法,相关算法已在GitHub仓库开源。

Comments Accepted in Quantum, 6 Aug 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 4 篇

2608.13662 2026-08-17 cs.AI cs.SE 新提交 81%

Ontology-Grounded Project Memory for Coding Agents

面向编码智能体的本体论基础项目记忆

James Adam

机构 * Trivyn(特里文公司)

专题命中 仓库级理解 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 针对编码智能体追踪代码变更原因的难题,提出MOOSEDev系统,该系统通过知识图谱存储项目信息,实验显示其在关键查询任务上显著优于基线工具,且相关性召回率与令牌成本相当。

Comments 5 pages. Accepted at NeSy 2026 (Industry Track); to appear in Proceedings of Machine Learning Research vol. 284. Benchmark artifact: https://github.com/Trivyn/moosedev

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14128 2026-08-17 cs.SE 新提交 79%

DepWareTrans: Dependency-Aware Incremental Repository Migration across Co-executable Languages

DepWareTrans:跨可共执行语言的依赖感知增量仓库迁移

Sivajeet Chand, Alexander Pretschner, Steve Haupt, Derui Zhu, Sushant Kumar Pandey

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 提出依赖感知增量迁移框架,构建依赖图分组文件进行批量翻译,在 STAR 仓库等上实现 100% 编译和测试成功率,提升仓库级代码翻译的可扩展性与可靠性。

Comments Accepted for publication in the Industry Showcase Track of the 41st IEEE/ACM International Conference on Automated Software Engineering, which will take place in Munich, Germany during October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13675 2026-08-17 cs.LG cs.AI 新提交 62%

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

从BERT到前沿智能体:八年语言模型进展、能力-成本曲线的崩溃及任务定向模型的兴起

Pranav Kumar Kaliaperumal

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 该文梳理2018-2026年语言模型进展,发现2024年末后编码能力年提升近6倍、能力-成本曲线崩溃,专用模型成趋势,Qwen 2.5数学测试及置信度工具验证了相关结论,研究材料全公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14377 2026-08-17 cs.CL cs.CV 新提交 57%

A Survey of Large Models in Sports

体育领域的大模型综述

Yichen Xu, Jianzhe Ma, Chuhan Wang, Zhonghao Cao, Liangyu Chen, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 该文综述体育领域大模型的任务应用、数据集基准,分析挑战与未来方向,为大模型驱动的体育智能研究与发展提供基础。

Comments 36 pages, 4 figures, 6 tables. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 1 篇

2607.08339 2026-08-17 cs.CL cs.AI cs.PL 版本更新 82%

TypeProbe: Recovering Type Representations from Hidden States of Pre-trained Code Models

TypeProbe:从预训练代码模型的隐藏状态中恢复类型表示

Giuliano Gorgone, Fausto Carcassi

机构 * ILLC, University of Amsterdam(逻辑、语言与计算研究所,阿姆斯特丹大学)

专题命中 程序分析与验证 :code model(title,abstract);分类 cs.CL、cs.AI、cs.PL

AI总结 研究代码模型内部编码类型信息的情况,利用Java和Python代码示例的并行数据集探测预训练代码模型的残差流获取类型表示,发现跨语言类型表示等结果,且结构对一些变化有鲁棒性,还发布了代码和数据集。

Comments 18 pages, 12 figures. Accepted at ESSLLI 2026 (StuS; double-blind)

详情

展开后加载摘要…

URL PDF HTML 收藏