arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 4132 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4132 篇

2601.19100 2026-08-24 cs.SE 版本更新 57%

Reward Engineering for Software Tasks: A Survey of Reinforcement Learning Approaches

软件任务中强化学习的奖励工程

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19882 2026-08-21 cs.AI 新提交 57%

TESTNAV: Pareto-Guided Search for Compositional Robustness Testing

TESTNAV:面向组合鲁棒性测试的帕累托引导搜索

Arooj Arif, Tobias Hartung, Elena Botoeva, Alexandros Koliousis

机构 * Northeastern University London(伦敦东北大学) University of Kent(肯特大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 TESTNAV是帕累托引导的鲁棒性测试框架,采用NSGA-II近似双目标帕累托前沿,在四类跨模态基准上,以35.8%-89.3%的扰动空间实现比基线快2.15倍的帕累托前沿恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19752 2026-08-21 cs.SE 新提交 57%

A Fully Automated, Deployment-Aware Testing Pipeline for IoT-Based Automotive Applications

面向物联网汽车应用的全自动、感知部署的测试流水线

Denesa Zyberaj, Roman Vintonyak, Pascal Hirmer, Marco Aiello

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 针对物联网汽车应用的测试难题,提出结合LLM、VLM及人在回路机制的感知部署测试流水线,经CPDS案例验证可实现全需求覆盖与高准确率,适配OEM-供应商测试工作流。

Comments Submitted, accepted and presented at IoTBDS26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19463 2026-08-21 cs.LG 新提交 57%

LLM as Detector: An In-context Learning Approach for Tabular Anomaly Detection

作为检测器的大语言模型:一种用于表格异常检测的上下文学习方法

Tu Anh Hoang Nguyen, Dang Nguyen, Thuc Duy Le, Trung Le, Sunil Gupta

机构 * Applied Artificial Intelligence Initiative (A2I2), Deakin University(应用人工智能计划(A2I2),迪肯大学) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本研究提出LLM-Detector框架,利用LLM的上下文学习能力进行表格异常检测,在24个数据集上对比15个SOTA基线均获提升,且无需微调或神经网络训练,降低了计算成本。

Comments Accepted at International Conference on Neural Information Processing (ICONIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19009 2026-08-21 cs.CL 版本更新 57%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: https://github.com/1549080929-debug/math_agent Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18279 2026-08-20 physics.optics cs.LG 新提交 57%

A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

面向纳米光子学的大语言模型综合综述:从代理建模到自主设计

Huanshu Zhang, Kegeng Tang, Lei Kang, Sawyer D. Campbell, Zihao Wang, Douglas H. Werner

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。

Comments Accepted for publication in Advanced Photonics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16911 2026-08-20 stat.CO cs.PL 版本更新 57%

r2py: AI-Assisted Conversion of R Statistical Packages to Python

r2py:用于AI辅助将R统计包转换为Python的框架

Yufei Cai, Jun Li

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本文提出r2py,这是Claude Code环境中首个七阶段AI辅助方法,可将R包系统转换为数值保真的原生Python库,在KernSmooth包上实现的r2py_kernsmooth通过518项测试,有效数字一致性达6-10位。

Comments v2: substantially extended. Adds a second case study (rpart) reached through R's .Call() interface, and a five-phase prologue reconstructing the portion of R's C API the package uses so its original C compiles without R. v1 covered KernSmooth only. Title shortened

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16890 2026-08-19 cs.AI 新提交 57%

GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents

GxP-Agent:基于流程有向无环图拓扑结构的可靠临床试验编程大模型智能体

Jaime Yan

机构 * Harrisburg University of Science and Technology(哈里斯堡科技大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究提出基于流程DAG拓扑的多智能体系统GxP-Agent,在临床试验编程任务上显著优于现有方法,实现了高结构匹配率,验证了编码领域流程知识为图拓扑的有效性。

Comments Preprint. 9 pages main text, 3 figures, plus references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17504 2026-08-19 physics.comp-ph cs.SE 新提交 57%

Agentic Porting, Construction and Initial Verification and Validation of Libraries within the Open Source Unified TRAnsient Multi-Phase Advanced Reactor simulation Kit (Outram Park) Part I: Thermal Hydraulics

开源统一瞬态多相先进反应堆模拟工具包(Outram Park)中库的智能体迁移、构建及初步验证与确认 第一部分:热工水力

Theodore Kay Chen Ong, Ethan Yew Hoe Wong, Sicong Xiao

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究将OpenFOAM库智能体迁移至Rust语言的Outram-Foam库,开发了两相HEM壅塞流求解器,验证显示其吻合度良好,智能体编码可提升开源库开发效率,人类专业知识仍为关键。

Comments 78 pages, 21 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09932 2026-08-19 cs.PL cs.AR 版本更新 57%

Automatically Generating ML Compiler Backends from Tensor Accelerator ISA Descriptions

从张量加速器ISA描述自动生成ML编译器后端

Devansh Jain, Akash Pardeshi, Marco Frigo, Kaustubh Khulbe, Krut Patel, Saatvik Lochan, Jai Arora, Charith Mendis

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本文提出ACT工具,可基于ISA描述自动生成张量加速器的XLA编译器后端,其生成的后端性能优于商用编译器,且提升了AWS Trainium的代码生成覆盖率。

Comments Accepted at OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16302 2026-08-18 cs.SE 新提交 57%

Comparing the Quality of Code Generated by Vibe Coding Tools

比较 vibe 编码工具生成代码的质量

Gustavo da Mota, Kiev Gama

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16207 2026-08-18 cs.AI 新提交 57%

Competing at Every Price Point with Agentic Evolution over a Menu of LLMs

基于LLMs菜单的智能体进化,在每个价格点展开竞争

Andrew Borthwick

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本研究提出进化元智能体RoboPhD,通过对含9个LLM端点的菜单进行智能体进化,在DS-1000和PaperFindingBench两个任务上,除一个位置外占据所有帕累托前沿槽位,实现各价格点的竞争优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14303 2026-08-17 cs.LG 新提交 57%

Detecting Contaminated Code-Generation Prompt Batches via Influence Functions

利用影响函数检测受污染的代码生成提示批次

Francesco Quinzan, Noor Munir, Yishun Lu, Stephen Roberts

机构 * The University of Oxford(牛津大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出与威胁模型无关的CodeSIFT方法,利用影响函数检测受污染的代码生成提示批次,在3B至7B参数的三个代码LLM上,中高注入率下AUROC达0.98,性能优于静态分析基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10492 2026-08-17 cs.AI cs.CY 版本更新 57%

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

洞察学生的思维:在LLM学生模拟器中联合建模潜在推理与行动

Rose Niousha, Minwoo Kang, Narges Norouzi

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究针对LLM学生模拟器仅复现学生行动却未捕捉其潜在推理的问题,提出INSIDE框架,通过在配对思考轨迹与行动上微调LLM,提升了模拟行动保真度与推理对齐度,最高对齐度达57.9%。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08444 2026-08-17 cs.SE 版本更新 57%

When LLMs Invent Rust Crates: An Empirical Study of Hallucination Patterns and Mitigation

当LLM发明Rust包:幻觉模式与缓解措施的实证研究

Jieming Zheng, Hao Guan, Yepang Liu

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究首次大规模实证分析LLM生成Rust代码中的包幻觉问题,发现不同模型幻觉率惊人一致且对参数不敏感,并探索了提示工程缓解策略。

Comments The work has been accepted by the 17th International Conference on Internetware

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11629 2026-08-17 cs.CR cs.LG 版本更新 57%

Semantic Differentiation for Tackling Challenges in Watermarking Low-Entropy Constrained Generation Outputs

语义分化用于解决水印标记低熵约束生成输出的挑战

Nghia T. Le, Alan Ritter, Kartik Goyal

机构 * School of Interactive Computing(交互计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 SeqMark通过语义分化解决低熵约束生成任务中水印标记的挑战,提升检测准确率并保持生成质量。

Comments 23 pages, 5 figures, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13317 2026-08-14 cs.AI 新提交 57%

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。

Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12518 2026-08-14 cs.SE 新提交 57%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00325 2026-08-14 cs.PL 版本更新 57%

Triton for MTIA: Bridging the Programming Model Gaps for Custom AI Accelerators

用于MTIA的Triton:弥合定制AI加速器的编程模型差距

Haishan Zhu, Domi Yan, Michael Levesque-Dion, Changxu Zhang, Mitch Gamburg, Kirsten Lee, Giancarlo Colmenares, Aditya Bhagwat, Arnab De, Markus Le Roux, Victor Perez Carrasco, Xin Tong, Will Cromar, Simran Barnwal, Andrew Uderian, Sridhar Gopinath, Jan Szczepaniec, Daniel Neilson, Blaine Burton Rister, Jordan Fix, Jazlyn Li, Zejun Huang, Lite Ye, Nan Zhang, Xinchen Guo, Andiry Xu, Michael Roberts, Kunming Ho, Site Cao, Suryadev Sahadevan Rajesh, Tristan Trouwen, Mike Tsai, Jake Lee, Wayne Su, Yuhan Chen, Xiaolong Xie, David Eklov, Aaron Barnes, Max Bremer, Adam Belay, Shintaro Iwasaki, Roman Levenstein, Ajit Mathews

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本研究将Triton应用于Meta定制ML加速器MTIA-2i,开发了专属编译器后端与TorchInductor增强,其内核性能可媲美专家调优的C++实现,已部署至生产环境覆盖大量模型,证明Triton可弥合编程模型差距。

Comments 12 pages, 12 figures, to be published in IEEE Micro

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11965 2026-08-13 cs.SE 新提交 57%

Developing LLM-based Multi-Agent Systems in Software Engineering: A Mixed-Method Experience Report

在软件工程中开发基于大语言模型(LLM)的多智能体系统:一项混合方法经验报告

Mariama Celi Serafim De Oliveira, Motunrayo Osatohanmen Ibiyo, Marco Gianrusso, Claudio Di Sipio, Davide Di Ruscio, Phuong T. Nguyen

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文通过定量和定性分析,梳理软件工程中基于LLM的MAS现有框架,发现其基本组件覆盖良好但缺高级功能,摘要任务ROUGE分数无显著差异,为相关人员选框架提供指导。

Comments The paper has been peer reviewed and accepted for publication with the Empirical Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09643 2026-08-11 cs.CR cs.LG 新提交 57%

Activation Probes Surface Code-Security Signals that the Model's Output Misses

激活探针:挖掘模型输出遗漏的表面代码安全信号

Ivan Wiryadi

专题命中 代码生成 :coding agent(abstract);分类 cs.LG

AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。

Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07888 2026-08-11 cs.PL 新提交 57%

Refined^2 Environment Classifiers

改进型^2环境分类器

Yuito Murase, Atsushi Igarashi

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本文针对带可变状态的MetaML风格多阶段编程,提出改进型环境分类器类型系统,排除有害作用域外溢,实现多级代码生成等功能,在Rocq中完成实现与机械化证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26504 2026-08-11 cs.LG 版本更新 57%

From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models

从接口到推理:从任意阶模型中引出任意阶推理

Seunggeun Kim, Jaeyeon Kim, Taekyun Lee, Yuyuan Chen, Yilun Du, Sham Kakade, Sitan Chen

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Harvard University(哈佛大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 该研究针对离散推理任务的任意阶推理需求,提出两种掩码扩散改进方法,训练对应模型验证了方法可诱导任意阶推理行为并提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16694 2026-08-11 cs.AI 版本更新 57%

RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning

RankGuide: 张量秩引导的路由与引导以实现高效的推理

Jiayi Tian, Yupeng Su, Ryan Solgi, Souvik Kundu, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Intel Labs(英特尔实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 RankGuide通过张量秩引导的路由与引导提升小推理模型与大推理模型的协作效率,减少推理延迟并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11027 2026-08-11 cs.LG 版本更新 57%

On the Effect of Sampling Diversity in Scaling LLM Inference

在LLM推理扩展中采样多样性的影响

Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校) Rensselaer Polytechnic Institute(罗切斯特理工学院) The Chinese University of Hong Kong(香港中文大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) NEC Laboratories America(NEC美国实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 57%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05208 2026-08-10 cs.CV cs.LG 版本更新 57%

Symbolic Graphics Programming with Large Language Models

基于大语言模型的符号图形编程

Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 代码生成 :program synthesis(abstract);分类 cs.LG

AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。

Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05959 2026-08-07 cs.SE 新提交 57%

AgentExecutor: Partial Code Execution via Agentic Context Generation

AgentExecutor:基于智能体上下文生成的部分代码执行工具

Junkai Chen, Chengran Yang, Xing Hu, Zhenhao Li, Xin Xia, David Lo

专题命中 代码生成 :program synthesis(abstract);分类 cs.SE

AI总结 本文提出多智能体框架AgentExecutor,通过三阶段设计和自适应优化策略提升部分代码执行效果,在两个数据集上的覆盖度、执行时间和成本均优于现有最优方法Treefix。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05561 2026-08-07 cs.SE 新提交 57%

Exploring Dependence, Overreliance, and Addiction Related Behaviors Associated with Large Language Model Use Among Software Engineers

探索软件工程师使用大语言模型(LLMs)相关的依赖、过度依赖及成瘾相关行为

Ronnie de Souza Santos, Italo Santos, Matheus de Moraes Leça, Cleyton Magalhaes, Mairieli Wessel

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究通过对119名软件从业者的调查,分析了工程师使用LLMs时的依赖、过度依赖及成瘾相关行为,发现LLMs已成为软件工程的习惯性工具,多数使用具功能性,需促进适当依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏