arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12227 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4122 篇

2105.09938 2021-11-10 cs.SE cs.CL cs.LG 67%

Measuring Coding Challenge Competence With APPS

Dan Hendrycks, Steven Basart, Saurav Kadavath, Mantas Mazeika, Akul Arora, Ethan Guo, Collin Burns, Samir Puranik, Horace He, Dawn Song, Jacob Steinhardt

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG

Comments NeurIPS 2021. Code and the APPS dataset is available at https://github.com/hendrycks/apps

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15339 2021-06-30 cs.SE cs.LG cs.PL 67%

SpreadsheetCoder: Formula Prediction from Semi-structured Context

Xinyun Chen, Petros Maniatis, Rishabh Singh, Charles Sutton, Hanjun Dai, Max Lin, Denny Zhou

专题命中 代码生成 :program synthesis(abstract);分类 cs.SE、cs.LG、cs.PL

Comments Published in ICML 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.12964 2021-04-21 cs.PL cs.AI cs.LG 67%

Representing Partial Programs with Blended Abstract Semantics

Maxwell Nye, Yewen Pu, Matthew Bowers, Jacob Andreas, Joshua B. Tenenbaum, Armando Solar-Lezama

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG、cs.PL

Comments ICLR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.05431 2021-01-21 cs.LG cs.AI cs.PL stat.ML 67%

Imitation-Projected Programmatic Reinforcement Learning

Abhinav Verma, Hoang M. Le, Yisong Yue, Swarat Chaudhuri

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG、cs.PL

Comments Published in Advances in Neural Information Processing Systems (NeurIPS) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.05249 2020-04-14 cs.SE cs.LG cs.PL 67%

Sequence Model Design for Code Completion in the Modern IDE

Gareth Ari Aye, Gail E. Kaiser

专题命中 代码生成 :code model(abstract);分类 cs.SE、cs.LG、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10665 2018-11-28 cs.AI cs.LG cs.PL 67%

Stepping Stones to Inductive Synthesis of Low-Level Looping Programs

Christopher D. Rosin

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG、cs.PL

Comments AAAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.01284 2018-03-09 cs.LG cs.AI cs.PL 67%

Towards Synthesizing Complex Programs from Input-Output Examples

Xinyun Chen, Chang Liu, Dawn Song

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG、cs.PL

Comments Published as a conference paper at ICLR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.04335 2018-02-14 cs.AI cs.CL cs.PL 67%

Neural Program Search: Solving Programming Tasks from Description and Examples

Illia Polosukhin, Alexander Skidanov

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI、cs.PL

Comments 9 pages, 3 figures, ICLR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22239 2026-04-27 cs.CL cs.AI 66%

Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA

在大规模文档集合中导航:MuDABench用于多文档分析问答

Zhanli Li, Yixuan Cao, Lvzhou Luo, Ping Luo

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Wenlan School of Business, Zhongnan University of Economics and Law(中南财经政法大学文澜商学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI;repository(comments)

AI总结 本文提出在大规模半结构化文档集合上进行分析问答的任务,介绍了MuDABench多文档分析问答基准,要求跨多个文档提取和综合信息以进行定量分析,实验发现标准RAG系统表现不佳,提出多代理工作流以提升性能。

Comments Findings of ACL 2026. The camera-ready version corrects some labeling errors. The accompanying repository is continuously updated based on community feedback; for the most up-to-date implementation and results, please refer to the repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18279 2025-05-07 cs.AI cs.CL cs.HC 66%

Large Language Model-Brained GUI Agents: A Survey

Chaoyun Zhang, Shilin He, Jiaxu Qian, Bowen Li, Liqun Li, Si Qin, Yu Kang, Minghua Ma, Guyue Liu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

机构 * Microsoft(微软公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI;repository(comments)

Comments The collection of papers reviewed in this survey will be hosted and regularly updated on the GitHub repository: https://github.com/vyokky/LLM-Brained-GUI-Agents-Survey Additionally, a searchable webpage is available at https://aka.ms/gui-agent for easier access and exploration

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23848 2026-08-26 cs.AI cs.LG 新提交 62%

Exploit More, Explore Smarter for Budget-Constrained Agentic Search

面向预算受限的智能体搜索:更充分利用,更智能探索

Haoyang Fang, Bernie Wang

机构 * Amazon AGI(亚马逊AGI)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对预算受限的智能体搜索场景,提出ExTS树搜索策略,结合三种机制优化树搜索,在多项任务上实现性能提升,还提供了问题结构差异的诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23842 2026-08-26 cs.SE cs.AI cs.DC 新提交 62%

Automated Synthesis of Cloud Emulators

云模拟器的自动化合成

Archit Bhatnagar, Zhenning Yang, Sarah McClure, Yiming Qiu, Sylvia Ratnasamy, Ang Chen

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 针对DevOps程序测试中云模拟器构建难的问题,提出基于神经符号代码合成的CloudEmu方法,其在AWS、GCP服务上的覆盖率与准确性优于手动开发的LocalStack。

Comments 12 pages, 8 figures, 5 tables, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22652 2026-08-25 cs.SE cs.AI 新提交 62%

Evaluating Inference-Time Defenses Against Package Hallucination in LLM-Generated Code

评估针对大语言模型生成代码中包幻觉的推理时防御措施

Alberick Euraste Djire, Iyiola E. Olatunji, Melissa Tessa, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。

Comments Accepted ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21483 2026-08-25 cs.SE cs.PL 新提交 62%

SLICE: Specification-Level Isolation of Contract Enforcement

SLICE:规约级别的契约执行隔离

Soohan Lim, Hyundong Jin, Yo-Sub Han

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 SLICE是一个分阶段的代码生成框架,通过规约结构化、函数体生成、契约断言生成三个阶段,在ContractEval数据集上使代码满足功能需求与输入契约的性能平均提升6.58%。

Comments 17 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00708 2026-08-25 cs.AI cs.LG 版本更新 62%

MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition

MOSAIC:结构化智能体智能与组合的模块化编排

Yifan Bao, Xinyu Xi, Xinyu Liu, Wen Ge, Lei Jiang, Kevin Zhang, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) University College London(伦敦大学学院) University of Edinburgh(爱丁堡大学) Data & Analytics, Digital X(Digital X 数据与分析部) Alan Turing Institute(艾伦·图灵研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出MOSAIC框架,通过结构化智能体编排、记忆驱动的模型选择和蓝图构建,将自动化数据科学转化为可验证、可复用的模型选择问题,在金融时间序列任务中优于AutoML和智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20381 2026-08-24 cs.CL cs.AI cs.HC 新提交 62%

EditPPT: Faithful Long-Deck Slide Editing via Structured Tool-Using Multi-Agent with Dual-Modal Validators

EditPPT:基于结构化工具使用多智能体与双模态验证器的忠实长文档幻灯片编辑

Jiheon Kim, Kyudan Jung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EditPPT多智能体框架,通过PowerPoint COM接口执行局部操作并结合双模态验证,在DeckEdit-Bench基准上实现高执行率等指标,解决长文档幻灯片编辑的级联错误问题。

Comments 30 pages, 7 figures, 17 tables, EMNLP 2026 submitted, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20349 2026-08-24 cs.CL cs.AI 新提交 62%

Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on Quality

提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析

Qipeng Xie, Zi Liang, Jiafei Wu, Yufei Chen, Weizheng Wang, Wenao Ma, Zhong Ming, Haiqin Yang, Kaishun Wu

机构 * Shenzhen Technology University(深圳技术大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang Lab(之江实验室) The Chinese University of Hong Kong(香港中文大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22202 2026-08-24 cs.SE cs.CL 版本更新 62%

Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries

LLM生成代码中的库幻觉:基于开发者查询的风险分析

Lukas Twist, Mark Harman, Helen Yannakoudakis, Jie M. Zhang

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。

Comments 28 pages, 1 figure, 13 tables. Accepted to Proceedings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-08-24 cs.LG cs.AI 版本更新 62%

AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05779 2026-08-20 cs.LG cs.SE 62%

Learning to Parallelize with OpenMP by Augmented Heterogeneous AST Representation

Le Chen, Quazi Ishtiaque Mahmud, Hung Phan, Nesreen K. Ahmed, Ali Jannesari

专题命中 代码生成 :program synthesis(abstract);分类 cs.SE、cs.LG

Journal ref Proceedings of Machine Learning and Systems, Vol. 5, pp. 442-456, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16970 2026-08-19 cs.CR cs.AI cs.LG 新提交 62%

Probing the Prefill: Detecting Code Vulnerabilities via Latent Activations

探测预填充:通过潜在激活检测代码漏洞

Alizishaan Khatri

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 该研究从四个LLM提取预填充标记激活训练MLP探测器,在四个代码漏洞基准上实现平均F1值41.7%,证明LLM自身代码表示含漏洞信息,为轻量原生筛查提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14653 2026-08-18 cs.LG cs.AI 新提交 62%

Do Uncertainty Signals Help? A Systematic Study of Uncertainty-Aware Decoding with Rollback Mechanisms

不确定信号是否有用?对带有回滚机制的不确定感知解码的系统研究

Xianzong Wu, Xiaohong Li, Yuejun Guo, Xinyang Liu, Tianlin Li, Junjie Wang, Qiang Hu

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统研究带有回滚机制的不确定感知解码,发现其可提升代码LLM的生成性能,其中token熵等信息论不确定信号效果最优,反馈引导的回滚是主要改进来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12186 2026-08-18 cs.SE cs.AI 版本更新 62%

Aletheia: What Makes RLVR For Code Verifiers Tick?

Aletheia: 什么使得代码验证器的RLVR有效?

Vatsal Venkatkrishna, Indraneil Paul, Iryna Gurevych

机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(保加利亚索菲亚大学INSAIT实验室) Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity(德累斯顿技术大学计算机科学系及应用网络安全国家研究中心通用知识处理实验室) ATHENE, Germany(德国ATHENE研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 通过消融实验研究RLVR训练代码验证器时,中间思考轨迹、负样本学习和策略内训练三个因素在不同规模下的性能-成本权衡,发现最优配方依赖于模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13596 2026-08-17 cs.LG cs.AI 新提交 62%

Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

通过激活引导剪枝实现跨模型规模的无训练知识迁移

Jiahe Fan, Si Chen, Yinghao Hou, Aiyuan Zhang, Hong Xie

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。

Comments 9 pages, 3 figures, and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21339 2026-08-17 cs.SE cs.PL 版本更新 62%

KBSpec: LLM-driven Formal Specification Generation with Evolving Domain Knowledge Base

KBSpec:基于演化领域知识库的LLM驱动形式化规约生成

Wenhan Wang, Zeyu Sun

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 提出KBSpec方法,利用外部官方文档和内部验证器反馈的双源知识增强LLM,通过自演化知识库持续更新成功轨迹,无需调参或标注数据,在JML规约生成上验证通过率提升10-25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13040 2026-08-14 cs.LG cs.CL 新提交 62%

Latent On-Policy Self-Distillation

隐式在线策略自蒸馏

Guibin Zhang, Jiayang Lyu, Ran Sun, Xinlei Yu, Haoyu Zhao, Qibing Ren, Shuicheng Yan

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出隐式在线策略自蒸馏(LOPD),将教师的特权上下文改为端到端可学习,在智能体工具使用和代码生成任务上,以远低于对比方法的rollout预算实现了更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11674 2026-08-13 cs.LG cs.AI 新提交 62%

GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束

Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10315 2026-08-12 cs.CL cs.AI 新提交 62%

Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

这是你的最终答案吗?跨上下文一致性作为大语言模型可信度的度量

Siyang Wu, Yibo Jiang, Bryon Aragam

机构 * University of Chicago(芝加哥大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出用跨上下文一致性(C3)度量大语言模型可信度,通过对比26个模型在6个基准上的原始与扰动提示生成结果,发现C3可作为互补评估维度与基准有用性诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05280 2026-08-12 cs.IT cs.AI cs.LG math.IT 版本更新 62%

On Solomonoff Induction in Large Language Models and the Limits of Self-Improving: The Singularity Is Not Near Without Symbolic Model Synthesis

在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近

Hector Zenil

机构 * Algorithmic Dynamics Lab(算法动力实验室) Department of Biomedical Computing(生物医学计算系) School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) King’s Institute for AI(国王人工智能研究所) King’s College London(伦敦国王学院) Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新中心) London Institute for Healthcare Engineering(伦敦医疗工程研究所)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG

AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。

Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09898 2026-08-11 cs.CL cs.LG 新提交 62%

Consilience for Verifier-Free Test-Time Scaling

无验证器的测试时扩展的一致性方法

Lecheng Kong, Like Hui, Haitao Mao, Jun Huan

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏