arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12194 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4113 篇

2604.04089 2026-07-14 physics.comp-ph cond-mat.str-el cs.AI cs.HC 版本更新 57%

From Paper to Program: Knowledge Externalization and Bottleneck Diagnosis in AI-Assisted Quantum Many-Body Programming

从论文到程序:AI辅助量子多体代码生成中的知识外化

Yi Zhou

机构 * Institute of Physics, Chinese Academy of Sciences, Beijing 100190, China(中国科学院物理研究所,北京100190,中国)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 针对AI直接翻译论文为代码时因隐含约定导致失败的问题,提出知识外化方法,通过多阶段人机协作流程将隐式假设显式化,在DMRG和Pfaffian-MPS任务上验证了有效性。

Comments 20 pages, 4 figures. Substantially revised presentation, related-work context, reproducibility documentation, validation-gate wording, limitations, and generative-AI disclosure; numerical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09072 2026-07-13 cs.SE 新提交 57%

Agentic Proof and Property-Based Testing via Property-Templates in Data-Intensive Computing

通过数据密集型计算中的属性模板进行智能体证明和基于属性的测试

Seongmin Lee, Yaoxuan Wu, Miryung Kim

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究软件工程中意图规范和验证问题,提出用属性模板解决验证候选属性和实施PBT的子问题,设计智能体双轨验证框架,经评估该框架能提高证明成功率、减少幻觉、降低成本并提升代码覆盖,还能发现模型与实现差距。

Comments 12 pages, 7 figures, 4 tables; supplementary material included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08885 2026-07-13 cs.SE 新提交 57%

Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions

程序员是大型语言模型生成断言的糟糕且过度自信的评判者

Zhanna Kaufman, Yuriy Brun, Adithya Murali, Madeline Endres

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究程序员评估大型语言模型生成断言的能力,通过实验发现程序员判断正确断言较准,判断错误断言较差,自然语言解释未带来整体益处,凸显帮助开发者评估机器生成可靠性工件的重要性。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20297 2026-07-13 cs.AI 版本更新 57%

Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge

通过BREW改进语言智能体:引导式经验学习环境知识

Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

机构 * University of Michigan(密歇根大学) Independent(独立研究者) Microsoft(微软) Apple(苹果公司)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 研究基于LLM的智能体无法从经验学习的问题,提出BREW框架,通过提炼交互轨迹成知识库、引入EG-MCTS算法及适应事后重标记等方法,在多基准测试中提升任务成功率并减少执行步骤,且知识库具有良好特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20134 2026-07-13 cs.AI cs.ET quant-ph 版本更新 57%

QAgent: An LLM-based Multi-Agent System for Autonomous OpenQASM programming

QAgent:一种基于大语言模型的用于自主OpenQASM编程的多智能体系统

Zhenxiao Fu, Lei Jiang, Yilun Xu, Gang Huang, Fan Chen

机构 * Zhenxiao Fu1, Lei Jiang1, Yilun Xu2, Gang Huang2, Fan Chen1(作者1、作者2、作者3、作者4、作者5)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究针对OpenQASM编程挑战提出QAgent,它是基于大语言模型的多智能体系统,集成规划、合成和校准工作流程,利用检索增强生成及多智能体推理确保正确性,在多模型评估中表现出色,证明集成对可靠量子程序生成很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07952 2026-07-10 cs.HC cs.CL 新提交 57%

fog: Expressing Motion and Emotion through Function Composition of AI-Generated Code

fog:通过人工智能生成代码的函数组合来表达运动和情感

Vivian Liu, Lydia Chilton

机构 * Columbia University(哥伦比亚大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 介绍fog函数组合框架,用于通过人工智能生成代码表达运动和情感,能创建运动词汇表并由动画编辑器辅助。经感知评估和用户研究,其运动函数识别准确率达68%,相比基线有显著提升,且在界面形式上支持用户快速迭代等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13723 2026-07-10 cs.SE 版本更新 57%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04809 2026-07-09 cs.SE 版本更新 57%

Watts This Smell: A Comprehensive Taxonomy of Software Energy Smells

一种经过验证的软件能耗异味分类

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Tushar Sharma

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出了一种全面的软件能耗异味分类,通过系统文献综述和雪球抽样,将320种低效模式分类为12种主要能耗异味和65种根本原因。通过实证验证,发现71%的样本存在多种共存的异味,内存相关异味的修复节能效果最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06519 2026-07-08 cs.AI 新提交 57%

FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference

FreqDepthKV:用于长上下文语言模型推理中稳健的键值缓存压缩的频率引导深度共享

Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús Olivera

机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究针对长上下文语言模型推理中键值缓存成本问题,提出FreqDepthKV方法,将相邻层键值状态分解,通过在线探测器分配缓存模式,在多基准测试中保持任务准确性,提升解码吞吐量并降低内存,实现高效压缩。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05659 2026-07-08 cs.SE 新提交 57%

Agents with Feelings? Personality and Emotion in Multi-Agent Software Teams

有情感的智能体?多智能体软件工程团队中的个性与情感

Yunyan Ding, Thomas Zimmermann, Iftekhar Ahmed

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究多智能体软件工程团队中个性和情绪特征对团队绩效的影响,采用结合多种因素的心理学框架,通过对78种团队配置评估发现配置显著影响性能、协作及成本,表明智能体配置是重要设计维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05762 2026-07-08 cs.SE hep-ex hep-ph 新提交 57%

Articulating Assumptions in AI-Generated Scientific Analyses through Task Decomposition

通过任务分解阐明人工智能生成的科学分析中的假设

Ahmed Hammad, Mihoko Nojiri

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究旨在解决大语言模型生成的科学分析结果的可理解性和可重现性问题,通过引入基于数量的语义差异多智能体框架及相关模块,经对撞机物理分析验证,模块化任务分解提升了透明度与可靠性,还能让小模型执行完整流程。

Comments 20 pages, 1 figure and 4 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25568 2026-07-08 cs.AI cs.CL cs.DB 57%

Are LLMs Overkill for Databases?: A Study on the Finiteness of SQL

LLMs在数据库中是否过时:对SQL有限性的研究

Yue Li, David Mimno, Unso Eun Seo Jo

机构 * Cornell University(康奈尔大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文通过376个数据库样本研究SQL查询的有限性,发现查询复杂度受现实需求限制,且模板分布呈现幂律特征,表明SQL查询可被模板高效覆盖。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02576 2026-07-07 stat.ML cs.LG 新提交 57%

CORA: Per-Slice Coherent Orthogonal Rotation for SVD-based Low-Rank Adaptation

CORA:基于切片的相干正交旋转,用于基于SVD的低秩适配

Pengcheng Wang, Ziran Liu, Wei Wang, Wei Jiang

机构 * Purdue University(普渡大学) Shanghai Institute for Mathematics and Interdisciplinary Sciences / Fudan University(上海数学与交叉科学研究院 / 复旦大学) Futurewei Technologies, Inc.(未来科技有限公司)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 针对现有基于SVD的PEFT方法未保留预训练奇异基耦合几何的问题,提出逐切片相干正交旋转适配方法CORA,参数量远低于同类方法,在常识推理、代码生成任务上性能更优。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02052 2026-07-03 cs.SE 新提交 57%

Mitigating Package Hallucinations in Large Language Models via Model Editing

通过模型编辑缓解大型语言模型中的包幻觉

Shuhan Liu, Yukai Zhao, Xing Hu, Kui Liu, Xiaohu Yang, Xin Xia

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出BOUND框架,通过定位与包幻觉相关的模块并应用边界感知的LoRA适配器编辑,有效降低LLM在包推荐、代码生成等任务中的包幻觉率,同时保持有效包推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01248 2026-07-03 cs.CY cs.AI 新提交 57%

A Practice Auditing Framework for Large Language Model Use: Collective Empiricism, Pseudo-Rational Cognition, and Governance of AI-Generated Content

大型语言模型使用的实践审计框架:集体经验主义、伪理性认知与AI生成内容治理

Yang Zhao, Yingshuo Li, Zeyu Zhang

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出实践审计框架,通过集体经验主义和伪理性认知概念分析LLM使用中的认知风险,并设计基于需求定义、证据审计等步骤的治理流程。

Comments English manuscript. 2 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31763 2026-07-03 cs.AI 新提交 57%

A Self-Evolving Agentic System for Automated Generation and Execution of Biological Protocols

一种用于自动生成和执行生物实验协议的自演化智能体系统

Yankai Jiang, Weiting Tang, Haoran Sun, Zhenyu Tang, Yuejie Hou, Yingnan Han, Rubo Wang, Yueyuxiao Yang, Cheng Liang, Lilong Wang, Wenjie Lou, Xiaosong Wang, Lei Bai, Meng Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Genoria AI

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出自演化多智能体系统ProtoPilot,结合专家基准与评估框架,将生物协议自动转化为可执行代码,并通过湿实验反馈迭代优化,实现高通过率的自主实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00939 2026-07-02 cs.SE quant-ph 新提交 57%

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

利用基于LLM的代理系统生成量子应用以优化测试

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30524 2026-07-02 cs.SE 版本更新 57%

The Illusion of Agentic Complexity in README.md Generation: Evaluating Single-Agent vs. Multi-Agent RAG Systems

README.md生成中的代理复杂性幻觉:评估单代理与多代理RAG系统

Abu Saleh, Tesfay Welegebreal Tesfay, Phuong T. Nguyen, Juri Di Rocco, Muhammad Umar Zeshan, Davide Di Ruscio

专题命中 代码生成 :repository(abstract);分类 cs.SE

AI总结 通过对比单代理、多代理和开发者引导规划三种RAG架构生成GitHub仓库README文件,发现单代理管道在词汇质量相当的情况下,令牌消耗降低86%、速度提升一倍,而多代理系统结构一致性达98%但存在规划瓶颈,开发者引导规划获得最佳文档质量。

Comments The paper has been peer-reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30810 2026-07-01 cs.SE 新提交 57%

Towards Knowledge Alignment in Code LLMs: Contrastive Unlearning for Evolving APIs

面向代码大语言模型的知识对齐:针对演化API的对比性遗忘

Huy Q. Tran, Dang H. Vu, Tuyen N. Dinh, Anh H. D. Nguyen, Anh N. H. Vu, Anh M. T. Bui, Phuong T. Nguyen

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出对比性遗忘方法CURE,在抑制废弃API的同时鼓励正确替代,使代码LLM适应演化库,实验表明该方法优于现有基线。

Comments The paper has been peer reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25747 2026-07-01 cs.SE 新提交 57%

CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues

CodeChat-Eval:在多轮代码优化对话中评估大型语言模型

Guoxiang Guo, Kla Tantithamthavorn, Neelofar Neelofar, Yuanyuan Qi, Aldeida Aleti

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出CodeChat-Eval框架,通过动态指令选择算法构建多轮代码优化对话评估会话,发现LLMs在多轮优化中功能正确性显著下降(19.2%-69.2%),逻辑级优化和新增请求导致最大下降。

Comments Accepted by ICSME26

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18440 2026-07-01 cs.SE 57%

Autonomous Agents in Software Development: A Vision Paper

软件开发中的自主代理:愿景论文

Zeeshan Rasheed, Muhammad Waseem, Kai-Kristian Kemell, Wang Xiaofeng, Anh Nguyen Duc, Kari Systä, Pekka Abrahamsson

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文探讨GPT代理在软件工程中的潜力,提出通过多代理协作提升软件开发效率,展示其在代码生成、文档编写等方面的能力,并规划未来研究方向。

Comments 5 pages, 1 figure

Journal ref International Conference on Agile Software Development, pp. 15-23, Springer, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29999 2026-06-30 cs.AI 57%

AlgoSkill: Learning to Design Algorithms by Scheduling Human-Like Skills

AlgoSkill: 通过调度类人技能学习设计算法

Xinyuan Song, Zekun Cai, Liang Zhao

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出AlgoSkill框架,将算法设计建模为基于类型化技能库的序列决策,通过MCTS和验证反馈调度技能,在竞赛编程和组合优化任务上优于直接生成和自优化方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29971 2026-06-30 cs.LG 57%

NeuReasoner: Theory-grounded Mapping of Reasoning Elicitation Boundaries

NeuReasoner: 理论驱动的推理激发边界映射

Aydin Javadov, Shyngys Aitkazinov, Tobias Hoesli, Florian von Wangenheim, Bjoern Schuller, Joseph Ollier

机构 * ETH Zürich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出理论驱动的NeuReasoner框架,通过神经透镜与认知透镜结合,在无需外部工具下激发大模型推理能力,在数学、编码及认知任务上匹配或超越后训练思维模式,并发现风险决策等边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29823 2026-06-30 cs.DB cs.AI cs.MA 57%

Experience Graphs: The Data Foundation for Self-Improving Agents

经验图:自我改进智能体的数据基础

Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanova, Uladzimir Pashkevich, Matt Steiner, Pedro Pedreira, Rob Fergus, Anirudh Goyal, Carole-Jean Wu, Gaoxiang Liu, Andrew Witten, Daniel J. Abadi

机构 * Meta Platforms(Meta平台) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出Trellis系统,将智能体探索过程产生的经验图作为一等数据库状态,通过查询、重用和物化视图支持跨会话复用和训练数据提取,在Meta的KernelEvolve中实现10倍加速和52%更低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28962 2026-06-30 cs.CR cs.LG 57%

FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

FlipGuard:防御针对大型语言模型的量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Suzhou Research Institute of Shandong University(山东大学苏州研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出FlipGuard防御框架,通过量化前扰动权重打破后门触发条件,有效抑制量化条件后门攻击,并引入DER指标统一评估安全、效用与成本。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03335 2026-06-30 cs.CL 57%

Compressed Sensing for Capability Localization in Large Language Models

压缩感知在大语言模型能力定位中的应用

Anna Bair, Yixuan Even Xu, Mingjie Sun, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28194 2026-06-29 cs.LG 新提交 57%

COCOLogic-V2: Identifying Logical Inconsistencies via Truly Hard-Negatives

COCOLogic-V2: 通过真正的困难负样本识别逻辑不一致性

David Steinmann, Antonia Wüst, Kristian Kersting, Wolfgang Stammer

机构 * Computer Science Department, TU Darmstadt(达姆施塔特工业大学计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) German Research Center for AI (DFKI)(德国人工智能研究中心) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学研究所SIC) RTG Neuroexplicit Models(RTG神经显式模型)

专题命中 代码生成 :program synthesis(abstract);分类 cs.LG

AI总结 提出COCOLogic-V2数据集,通过正样本、近边界和远边界负样本分类,评估模型在真实图像上的视觉归纳推理能力,发现模型在近边界样本上表现差,视觉归纳推理仍是开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27138 2026-06-26 cs.PL 新提交 57%

Welterweight Go: Boxing, Structural Subtyping, and Generics (Extended Version)

次重量级Go:装箱、结构子类型和泛型(扩展版)

Raymond Hu, Julien Lange, Bernardo Toninho, Philip Wadler, Robert Griesemer, Keith Randall

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 提出WG核心模型,涵盖Go的底层类型、类型联合和类型集等关键特性,并开发LWG低级语言模拟运行时机制,通过类型导向编译实现泛型方法等新特性,避免运行时代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26671 2026-06-26 cs.AI 新提交 57%

NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

NebulaExp-8B:基于全尺度消融研究的经验性后训练流程

Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

机构 * ZTE NebulaL0 Post-Training Team(中兴通讯NebulaL0后训练团队)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出NebulaExp透明后训练流程,基于Qwen3-8B-base,通过数据清洗、三阶段SFT和GRPO RL优化指令与推理分支,并探索OPD/MOPD替代RL,在8B模型上实现性能提升。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26173 2026-06-26 cs.AI 新提交 57%

AlgoEvolve: LLM-driven Meta-evolution of Algorithmic Trading Programs

AlgoEvolve:LLM驱动的算法交易程序元进化

Dhruv Sharma, Gautam Shroff

机构 * Indraprastha Institute of Information Technology, Delhi(德里英迪拉普拉萨信息技术学院)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 提出AlgoEvolve框架,利用LLM作为语义变异算子进化交易策略,通过元进化外层循环优化提示,在噪声、非平稳的金融环境中实现自适应策略逻辑,优于人工设计指令。

详情

展开后加载摘要…

URL PDF HTML 收藏