arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-28 至 2026-08-28 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2608.25457 2026-08-28 cs.CR cs.AI cs.MA 版本更新 79%

MACGen: Toward Functionally Correct and Secure Code Generation via Multi-Agent Collaboration

MACGen:通过多智能体协作实现功能正确且安全的代码生成

Miseon Yu, Jaehoon Choi, Younghan Lee, Yunheung Paek

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 MACGen是整合规划等多环节的多智能体代码生成框架,在CWEval、BaxBench基准上,较直接提示显著提升安全代码生成的功能与安全性指标。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26588 2026-08-28 cs.CR cs.SE 新提交 74%

Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation

未言明即不安全?基于大语言模型的RTL代码生成中的隐式安全义务

Guang Yang, Xing Hu, Xiang Chen, Xin Xia

专题命中 代码生成 :code generation(title);分类 cs.SE

AI总结 该研究针对LLM生成RTL代码的隐式安全问题,构建了SECRTL-GEN基准,提出神经符号框架RTL-Obliger,可显著提升LLM生成RTL的安全与功能通过率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02475 2026-08-28 cs.SE 版本更新 74%

Lost in Code Generation: Reimagining the Role of Software Models in AI-driven Software Engineering

在代码生成中迷失:重新构想软件模型在AI驱动软件工程中的作用

Jürgen Cito, Dominik Bork

专题命中 代码生成 :code generation(title);分类 cs.SE

AI总结 该研究针对AI生成软件存在的缺陷,提出从AI生成系统中恢复软件模型,区分智能体与人类反思循环,将软件模型作为连接现有软件工程与AI驱动开发的桥梁,拓展了软件模型的作用。

Comments New version accepted at MODELS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27017 2026-08-28 cs.IR 新提交 71%

ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

ProRetrieval:通过可执行程序合成学习编排混合搜索

Chengsong You, Zhen Sun, Yunhai Hu, Junwei Zhou, Xiaoyu Cao, Binyu Li, Ziyan Zhao, Weiyao Wang, Liren Lu, Zhijie Ye, Yumo Cao, Yitao Long, Yiwei Xu, Qiyi Jiang, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yiran Zou, Nan Du

专题命中 代码生成 :program synthesis(title)

AI总结 ProRetrieval 将语言模型作为检索编排器,通过混合 DSL 合成可执行程序,在两个新基准上训练 Qwen3-4B,其 4B 模型在电商、邮件检索任务中优于 GPT-5.5 等主流模型及各类基线。

Comments 15 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26557 2026-08-28 cs.SE 新提交 70%

DeepRepro: State-Aware Subplanning for Paper-to-Code Reproduction in Evolving Repositories

DeepRepro:面向演化仓库中论文到代码复现的状态感知子规划

Hongru Song, Ruqing Zhang, Jiafeng Guo, Xueqi Cheng, Maarten de Rijke

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 针对现有论文到代码复现系统因静态规划易出现不一致的问题,提出DeepRepro状态感知框架,通过动态生成子规划并结合编排与监控,在PaperBench Code-Dev上表现优于基线

Comments Accepted by CIKM2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27148 2026-08-28 cs.SE 新提交 57%

AgentDV: Closed-Loop Agentic AI for Hardware Design Verification

AgentDV:用于硬件设计验证的闭环智能体AI

Navya Goli, Junzhe Liu, Zhenge Jia, Umamaheswara Rao Tida

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 AgentDV是用于自动RTL验证的闭环智能体AI框架,通过三项关键技术优化,在三类LLM上显著提升了测试平台的通过率与代码、分支覆盖度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26110 2026-08-28 cs.DC cs.AI 新提交 57%

Exploring the Role of LLMs in HPC Programming: A Survey

探索大语言模型(LLM)在高性能计算(HPC)编程中的作用:一项综述

Strahinja Ljaljevic, Josep Jorba, Sergio Iserte

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本综述梳理了LLM在HPC编程五大类任务中的应用,指出通用LLM在串行等任务表现尚可但分布式范式不足,领域专用模型准确率更高但范围狭窄,LLM短期内无法取代HPC专家,将成为软件开发的强大合作者,二者融合是长期共同演化过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29239 2026-08-28 cs.CR 版本更新 50%

QuantGuard: Learnable Rounding for Repairing Quantization-Conditioned Backdoors in LLMs

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen, Shanqing Guo, Kening Zheng

专题命中 代码生成 :code generation(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2608.26602 2026-08-28 cs.SE cs.CL 新提交 81%

The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning

千图假说:仓库级代码推理中任务条件关系实例化的可检验假说

Fei Ding

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL

AI总结 针对仓库级代码推理的上下文限制与关系图维护问题,该研究提出带任务条件关系实例化的仅实体外部接口,经DeepSeek-V4-Flash和SWE-bench Verified评估,双层索引方案在零预构建边时成功率达95.6%。

Comments 9 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18064 2026-08-28 cs.SE cs.AI 版本更新 81%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-08-28 cs.AI 版本更新 74%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 软件智能体 :coding agent(title);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26218 2026-08-28 cs.AI cs.SE 新提交 62%

Same Model, Different Harness: Different Coding-Agent Results

相同模型,不同工具链:编码智能体的结果差异

Sydney Lewis

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文探究模型与任务固定时,工具链改变对编码智能体结果的影响,发现特定工具链配置可提升模型在编码基准的表现,故编码智能体评估需将模型与工具链共同视为求解器。

Comments 24 pages, 9 figures. Software and study artifacts: this https URL (https://github.com/sydches/yuj)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26130 2026-08-28 cs.CL cs.IR 新提交 57%

Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses

智能体不进行分页:面向大语言模型工具响应的首块选择

Tatiana Petrova, Andrei Mazniak, Radu State

机构 * SnT, University of Luxembourg(卢森堡大学SnT(卢森堡大学安全、可靠性与信任中心))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 该研究针对LLM编码智能体的工具响应首块选择问题,发现提升首块Top1准确率不会系统性提升下游准确率,无参数关键词评分器可提升p₁但不影响下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2506.23749 2026-08-28 cs.SE 版本更新 79%

A Survey of LLM-based Automated Program Repair: Taxonomies, Design Paradigms, and Applications

基于大型语言模型的自动程序修复综述:分类、设计范式与应用

Boyang Yang, Zijian Cai, Fengling Liu, Bach Le, Lingming Zhang, Tegawendé F. Bissyandé, Yang Liu, Haoye Tian

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 本文综述了基于LLM的自动程序修复,提出统一分类法,涵盖四种范式,并讨论了评估实践和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18782 2026-08-28 cs.SE 版本更新 79%

Code Summaries as Diagnostic Context for LLM-Based Program Repair

基于摘要的修复:大语言模型能否将代码摘要作为程序修复工具?

Lukas Twist, Jie M. Zhang

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 本研究提出基于摘要的程序修复方法,利用代码摘要作为中间步骤,通过提升修复效果来改进大语言模型在程序修复中的表现。

Comments 7 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2608.24135 2026-08-28 cs.AI cs.SE 版本更新 62%

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习

Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 2 篇

2608.26149 2026-08-28 cs.AI cs.LG 新提交 62%

Methodological and Conceptual Framework for 5D Multi-Table Analysis: A Unified Approach for Complex Data Reuse

用于五维多表分析的方法与概念框架:复杂数据复用的统一方法

Edouard Lansiaux, Hugo Kazzi, Aurélien Loison, Slim Hammadi, Emmanuel Chazard

机构 * CHU de Lille(里尔大学中心医院) Lille Centrale Institute(里尔中央理工学院) Lille University(里尔大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出关系超图Transformer(RHT)架构,用于解决复杂关系数据的多表学习问题,在Synthea数据集上验证其生成语义连贯嵌入的能力,计划后续在MIMIC-IV上开展临床验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26235 2026-08-28 cs.AI cs.PF 新提交 57%

The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts

推理成本:不同任务类型与部署场景下大语言模型推理的令牌经济学

Sachin Gopal Wani, Ajay Dholakia, David Ellison

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 该研究提出令牌经济得分(TES)指标,通过151组实证分析发现任务结构比难度更影响推理效率,推理投入存在收益递减,应按需选择性启用大语言模型推理。

Comments 15 pages, 8 figures and tables, accepted at the 2026 TPCTC Conference and will be published at Performance Evaluation and Benchmarking (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 5 篇

2608.27125 2026-08-28 cs.SE 新提交 57%

AROMA+: A Study of Factors Affecting Reproducible Builds in the Maven Ecosystem

AROMA+:Maven生态系统中影响可复现构建的因素研究

Mehdi Keshani, Amirhossein Rahmati, Mohammad Hossein Aref, Abbas Heydarnoori

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究针对Maven生态系统可复现构建研究不足的问题,开发工具AROMA+自动获取相关信息,准确率达99.8%,实现32%软件包自动可复现,贡献部分软件包至Reproducible Central并公开数据集与工具。

Comments Extended version of a paper accepted at FSE 2024 (ACM International Conference on the Foundations of Software Engineering). Currently under review at Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27100 2026-08-28 cs.SE 新提交 57%

Mutation Testing for Reproducibility Safeguards in Machine Learning Research Software: An Empirical Study

机器学习研究软件中用于可复现性保障的突变测试:一项实证研究

Ilya Shulepov

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究以MLReproMutate为工具,对39个机器学习研究仓库开展实证研究,发现现有验证工作流仅能检测8.7%的可复现性相关突变,提出可复现性导向的突变测试作为补充评估方式。

Comments 27 pages. Software and frozen empirical artifacts available at this https URL (https://doi.org/10.5281/zenodo.22126120)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-28 cs.SE 版本更新 57%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26911 2026-08-28 eess.SP 新提交 50%

autowerkstatt4null: An Off-Board-Diagnostics Ecosystem for Car-Workshops

autowerkstatt4null:面向汽车维修厂的车外诊断生态系统

Stephan Bökelman, Rene Glitza, Meihui Huang, Odin Holmes, Lukas Jakubczyk, Tabea Röthemeyer

专题命中 仓库级理解 :repository(abstract)

AI总结 该项目推出autowerkstatt4null生态系统,为独立汽车维修厂提供AI驱动的联邦诊断技术,通过模块化测量平台等创新助力维修厂获得高级诊断能力,提升行业竞争力与可持续性。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26358 2026-08-28 econ.GN 新提交 50%

An Anonymized Urn-Based Experimental Dataset on Decision-Making under Risk and Ambiguity

基于瓮模型的风险与模糊性下决策的匿名化实验数据集

Václav Kratochvíl, Radim Jiroušek, Klára Šimůnková, Simona Bažantová

专题命中 仓库级理解 :repository(abstract)

AI总结 本文发布了风险与模糊性决策实验的匿名化数据集,含246名参与者的4486条记录,支持重复研究、模糊态度模型比较及行为稳定性分析。

Comments 16 pages, 1 figure. Data descriptor accompanying an anonymized experimental dataset on decision-making under risk and ambiguity

详情

展开后加载摘要…

URL PDF HTML 收藏