arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-25 至 2026-08-25 共收录 28 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 7 篇

2608.22938 2026-08-25 cs.SE cs.AR 新提交 79%

Execution-Anchored Hallucination Calibration Reranking for Verilog Code Generation

面向Verilog代码生成的执行锚定幻觉校准重排序

Guang Yang, Xing Hu, Xiang Chen, Terry Yue Zhuo, Xin Xia

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 该研究针对LLM生成Verilog代码时的性能问题,提出EAHC重排序框架,通过双通道架构融合执行与推理信号,解决现有方法的域迁移差和推理幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22529 2026-08-25 cs.SE 新提交 79%

Benchmarking the Titans: A Multi-Dimensional Empirical Evaluation of LLM Code Generation Quality in the.NET Ecosystem

巨头基准测试:.NET生态系统中LLM代码生成质量的多维度实证评估

Seyed Mohammad Mahdi Ghalandarian, Majid Bazargani, Masoumeh Taromirad

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出自动化多维度评估框架,针对C#代码生成评估GPT等四个LLM,发现Pass@k排名无法反映LLM在软件工程场景的完整性能概况,还明确了GPT的双峰失败行为。

Comments 12 pages, 8 figures. Accepted at the Second Workshop on Large Language Models for Generative Software Engineering (LLM4SE 2026), co-located with STAF 2026, Rennes, France, June 29 - July 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22652 2026-08-25 cs.SE cs.AI 新提交 62%

Evaluating Inference-Time Defenses Against Package Hallucination in LLM-Generated Code

评估针对大语言模型生成代码中包幻觉的推理时防御措施

Alberick Euraste Djire, Iyiola E. Olatunji, Melissa Tessa, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。

Comments Accepted ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21483 2026-08-25 cs.SE cs.PL 新提交 62%

SLICE: Specification-Level Isolation of Contract Enforcement

SLICE:规约级别的契约执行隔离

Soohan Lim, Hyundong Jin, Yo-Sub Han

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 SLICE是一个分阶段的代码生成框架,通过规约结构化、函数体生成、契约断言生成三个阶段,在ContractEval数据集上使代码满足功能需求与输入契约的性能平均提升6.58%。

Comments 17 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23200 2026-08-25 cs.CL 新提交 57%

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因

Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang

机构 * EvoMap Tsinghua University(清华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22068 2026-08-25 cs.AI cs.CE 新提交 57%

Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays

面向地热井阵列的大型语言模型决策支持与建模

Edwin Ouko, Emmanuel Lujan, Alan Edelman, Robert Metcalfe

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本研究评估ChatGPT等前沿LLMs在地热领域的应用潜力,提出用NotebookLM加速生成地热基准,分析地热井阵列等技术的机遇,还展示了LLMs助力地热数值模型自动并行化的案例。

Comments 10 pages, 8 figures. Presented at the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, February 10-12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21417 2026-08-25 cs.AI cs.RO 新提交 57%

Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol

基于检索的机器人程序生成与基于仿真的修正:通过模型上下文协议

Zhichao Zhou, Siyuan Chen, Omkar Salunkhe, Ebru Turanoglu Bekar, Johan Stahre, Anders Skoogh

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究针对柔性制造中机器人快速重编程需求,提出结合RAG与MCP的工作流,可生成并修正ABB RAPID机器人程序,借助仿真暴露代码执行故障,减少专家监督需求。

Comments Accepted by CIE53; to appear in the CIE53 Proceedings, Khalifa University, Abu Dhabi, UAE, October 20-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2608.23564 2026-08-25 cs.CL cs.AI cs.SE 新提交 89%

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

SWE Refactor Bench:编码智能体能完成长周期的全仓库栈迁移吗?

Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

机构 * Navers Lab(Navers实验室) Tsinghua University(清华大学)

专题命中 软件智能体 :repository(title,abstract);coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本研究推出SWE Refactor Bench基准,通过三阶段评估发现前沿编码智能体仅5.4%能完成全仓库迁移,且迁移完整性与行为正确性是不同能力,该基准可作为可靠全仓库迁移编码智能体的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21747 2026-08-25 cs.SE cs.AI cs.CL 新提交 82%

Architecture as Capability Equalizer for Coding Agents

架构作为编码智能体的能力均衡器

Arquimedes Canedo

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 该研究对比5种架构规范格式对6种LLM编码智能体的代码生成质量影响,发现结构化格式可作为能力均衡器,显著提升弱模型性能,对成本优化部署价值最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22191 2026-08-25 cs.AI cs.SE 新提交 81%

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

探索时持异议,提交时持共识:面向软件智能体的路由引导测试时缩放

Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 软件智能体 :software agent(title);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对软件智能体测试时缩放难题,提出Risa方法,利用MoE路由轨迹引导探索与仲裁,在SWE-bench等基准上提升了仓库级软件工程任务的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21833 2026-08-25 cs.AI cs.CL 新提交 81%

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Lightspeed Studios, Tencent(腾讯光速工作室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22960 2026-08-25 cs.AI 新提交 79%

What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels

代码智能体的过程评估实际测量什么:动作、任务和步骤是三个不同的层级

Jiawei He, Mengyu Shi, Jie jia, Xikai Yang, Dong Sun

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究提出代码智能体过程评估的测量框架,用SCAE实现步骤级因果归因,经499个文件定位场景实验发现当前过程评估多测量语义相关性而非因果贡献。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21929 2026-08-25 cs.CR cs.CL 新提交 79%

SkillBloat: Token Amplification Attacks via Skill Injection in LLM Coding Agents

SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击

Yuanjin Zheng, Jingbang Chen

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23336 2026-08-25 cs.CV 新提交 78%

Can Coding Agents Build Robust Baselines? A Skill-Based Approach for Automating the Medical Imaging Model-Development Pipeline

编码智能体能构建鲁棒基线吗?一种基于技能的医学影像模型开发流水线自动化方法

Eugenia Moris, José Ignacio Orlando

机构 * Arionkoder LLC(阿里昂科德有限责任公司) Yatiris(亚蒂里斯) UNICEN-CONICET(国立中央大学-阿根廷国家科学技术研究委员会)

专题命中 软件智能体 :coding agent(title);code generation(abstract)

AI总结 该研究提出一种结合文献引导推理等的智能体式AI科学家工作流,可自动化医学影像模型开发流水线,在四个公开基准上取得竞争力结果,大幅降低相关工程工作量。

Comments MICCAI 2026 Workshop AgenticMed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21942 2026-08-25 cs.AI cs.CR cs.MA cs.NI 新提交 57%

TessIndex: Capability Verified Identity System for the Agent Economy

TessIndex:面向智能体经济的能力验证身份系统

Mehul Goenka, Tejas Pathak, Siddharth Asthana

机构 * University of Oxford(牛津大学) Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 针对智能体经济基础设施的三大缺陷,提出采用双平面架构的TessIndex系统,实现智能体原语的持久身份、可验证能力声明及价值捕获,为智能体经济提供集成化身份支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2608.21718 2026-08-25 cs.SE 新提交 57%

XRFix: Exploring Performance Bug Repair of Extended Reality Applications with Large Language Models

XRFix:利用大语言模型探索扩展现实应用的性能缺陷修复

Jingwen Wu, Hanyang Guo, Hong-Ning Dai, Xiapu Luo

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 该研究针对XR应用性能缺陷修复的技术挑战,提出基于大语言模型的XRFix框架,构建缺陷数据集与定制检测工具,经实验验证其修复性能优于SOTA APR方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2608.21558 2026-08-25 cs.CL cs.AI 新提交 62%

Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation

通过TRIAD实现多跳RAG评估自动化:从上下文提取到验证数据集生成

Lorenz Brehme, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TRIAD三阶段自动化多跳RAG评估数据集生成方法,经与MuSiQue、HotpotQA对比验证,该生成数据集可有效评估特定领域RAG系统性能,相关代码与验证结果已公开。

Comments Accepted at the 19th International Natural Language Generation Conference (INLG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21398 2026-08-25 cs.LG cs.AI cs.CY cs.HC cs.MA 新提交 62%

Runtime Action Interference for AI Control of AlphaStar in StarCraft II

星际争霸II中AlphaStar的AI控制之运行时动作干预

Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao

机构 * University of New South Wales(新南威尔士大学) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出运行时动作干预(RAI)机制,将其应用于AlphaStar复现版并开展《星际争霸II》人类实验,发现向用户披露AI对手能力会显著影响人类对其公平性、毒性的感知,需将执行栈控制与能力披露分开评估。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 7 篇

2608.21964 2026-08-25 cs.AI cs.SE 新提交 81%

Repo2Skill-Evo: Repository Skills Go Stale in Silence

Repo2Skill-Evo:仓库技能在静默中过时

Chenyuan Duan, Ge Shi, Zineng Mao, Ge Zhang, Hao Liang, Yinzhu Piao, Yuchen Wu, Zhixin Yao, Kaiyu Huang, Wenhao Huang, Linzhuang Sun, Shen Yan, Wentao Zhang

机构 * ByteDance(字节跳动) Peking University(北京大学) Beijing Jiaotong University(北京交通大学)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 Repo2Skill-Evo研究发现,在57个真实仓库的105次版本转换中,前沿智能体难以可靠维护仓库技能,其平均@3 macro F1仅29.9%-69.7%,仓库技能会在无明确信号的情况下静默过时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21794 2026-08-25 cs.CL cs.AI cs.HC 新提交 62%

Lexical Coupling in GUI Element Grounding: Sentence Embeddings Track Labels across Mobile and Web

GUI元素定位中的词汇耦合:句子嵌入追踪移动端与网页的标签

Qijia Chen, Giulio Jacucci

机构 * University of Helsinki(赫尔辛基大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对GUI定位评估中嵌入相似度与语义定位的混淆问题,对比编码器与词汇基线,提出需报告词汇基线等诊断指标以区分标签恢复与语义定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22928 2026-08-25 cs.PL cs.CR 新提交 57%

When Can Agents Safely Checkpoint, Fork, Restore, and Merge? Exact Checking for Execution Edits

智能体何时能安全地进行检查点、分叉、恢复与合并?执行编辑的精确检查

Yusheng Zheng, Xiaoyu Song, Yanpeng Hu, Lebin Cheng, Yuxi Huang, Wei Zhang

专题命中 仓库级理解 :repository(abstract);分类 cs.PL

AI总结 该研究针对智能体的检查点、分叉等执行编辑操作,提出一种精确判定编辑安全性的算法,通过形式化方法验证,相关成果已在 Lean 中实现并开源。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22215 2026-08-25 cs.CL 新提交 57%

Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation

带有快速写入路由与慢速整合的双层智能体记忆

Wenzhi Li, Dong Nie, Rui Lan, Tongtong Lyu, Peiyao Wang, Lingzi Hong, Weihang Pan, Boyuan Pan, Yao Hu

机构 * Zhejiang University(浙江大学) Xiaohongshu(小红书) University of North Texas(北得克萨斯大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 该研究针对LLM智能体动态环境下的记忆管理问题,提出双层智能体记忆框架,通过成本感知路由与周期性整合实现高效记忆处理,在保留高检索性能的同时减少冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22045 2026-08-25 cs.HC cs.AI 新提交 57%

Multi-Agent Discovery and Resource-Aware Autonomous Exploration of Scientific Datasets

科学数据集的多智能体发现与资源感知自主探索

Aashish Panta, Hugo Lee, Giorgio Scorzelli, Kyongsik Yun, Valerio Pascucci

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 针对单个研究者难以发现探索大规模科学数据集的问题,提出WebVisus多智能体系统,可基于自然语言问题启动自主智能体,适配资源探索数据集并完成案例验证。

Comments 10 pages, 4 figures, 1 table. To appear in 2026 IEEE eScience Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-25 cs.SE 新提交 57%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23320 2026-08-25 cs.RO 新提交 50%

ROS2SmolVLA: Enabling Small Vision-Language-Action Models for Integration into Industrial-Grade Lightweight Robots

ROS2SmolVLA:适用于集成到工业级轻量机器人的小型视觉-语言-动作模型

Nils Mandischer, Noah Böckmann, Ludwig Holl, Lars Mikelsons

机构 * University of Augsburg(奥格斯堡大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本研究将SmolVLA适配于Universal Robots轻量机器人,发布ROS2SmolVLA开源接口,通过UR10e取放任务验证其功能,为工业级轻量机器人提供了本地可计算的小型VLA模型方案。

Comments Accepted at 8th International Conference on Industry of the Future and Smart Manufacturing, Padua & Venice, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 2 篇

2608.21516 2026-08-25 cs.SE cs.PL 新提交 62%

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning

神经形式化验证:智能体的语言无关形式化程序推理

Shuvendu K. Lahiri

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.SE、cs.PL

AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22630 2026-08-25 cs.PL 新提交 57%

VeGo: Direct Deductive Formal Verification of Go Programs for Computer Science Education

VeGo:面向计算机科学教育的Go程序直接演绎形式化验证

Tina Massoudi, Chris Dutchyn

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.PL

AI总结 该研究提出面向计算机科学教育的VeGo系统,可直接验证标准Go程序,整合多种形式化验证技术,对比其他语言论证Go的优势,经教育教材评估并规划了形式并发规约的路线图。

Comments 13 pages + 2 pages of references, 5 code displays, ancillary reference manual for VeGo

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他AI编程 1 篇

2608.22089 2026-08-25 cs.CR cs.AI 新提交 57%

On Predicting Vulnerability Severity Using In-Context Learning: An Industrial Case Study

利用上下文学习预测漏洞严重性:一项工业案例研究

Daniel Rodriguez-Cardenas, David Nader Palacio, Anna Schmedding, Yiyang Lu, Aadil Mallick, Bill Hudson, Chris Gourley, Michael Roytman, Chris Shenefiel, Evgenia Smirni, Denys Poshyvanyk

专题命中 其他AI编程 :code model(abstract);分类 cs.AI

AI总结 本研究通过工业案例,用可本地部署的开源LLM的上下文学习从C/C++代码片段预测CVSS v3.1评分,发现CodeLlama2-7B在轻量输出约束提示下可接近云服务性能,且Big-Vul可作为工业数据代理。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏