arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-03 至 2026-02-03 共收录 40 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 17 篇

2601.21526 2026-02-03 cs.AI cs.CL cs.SE 85%

KAPSO: A Knowledge-grounded framework for Autonomous Program Synthesis and Optimization

KAPSO:一种基于知识的自主程序合成与优化框架

Alireza Nadafian, Alireza Mohammadshahi, Majid Yazdani

机构 * Leeroo Team(Leeroo 团队)

专题命中 代码生成 :program synthesis(title,abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 KAPSO通过整合实验引擎、知识系统和认知记忆层,解决编码代理中的长周期失败问题,提升自主程序合成与优化的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00066 2026-02-03 cs.SE cs.CL cs.LG 82%

IntentCoding: Amplifying User Intent in Code Generation

IntentCoding: 提升代码生成中用户意图的遵循能力

Zheng Fang, Yihong Dong, Lili Mou, Dongming Jin, Zhi Jin, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 IntentCoding通过增强用户意图的影响力,提升代码生成中对约束条件的遵循能力,显著提高约束满足和功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01187 2026-02-03 cs.SE cs.AI 81%

Autoregressive, Yet Revisable: In Decoding Revision for Secure Code Generation

自回归 yet 可修订:在解码修订中实现安全代码生成

Chengran Yang, Zichao Wei, Heminghao Deng, Jinfeng Jiang, Zhensu Sun, Ting Zhang, Tianyi Wu, Ming Wen, David Lo

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出“修订流”范式,通过引入特定操作令牌实现代码生成的动态自我纠正,有效减少安全代码生成中的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20615 2026-02-03 cs.SE 79%

DRAINCODE: Stealthy Energy Consumption Attacks on Retrieval-Augmented Code Generation via Context Poisoning

DRAINCODE: 通过上下文污染对基于检索增强的代码生成进行隐秘的能量消耗攻击

Yanlin Wang, Jiadong Wu, Tianyue Jiang, Mingwei Liu, Jiachi Chen, Chong Wang, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 DrainCode通过上下文污染攻击,显著增加LLM的延迟和能耗,揭示了RAG代码生成系统在安全性和资源约束下的潜在风险。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11708 2026-02-03 cs.SE 79%

From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation

从评估到增强:大型语言模型在零知识证明代码生成中的应用

Zhantong Xue, Pingchuan Ma, Zhaoyu Wang, Yuguang Zhou, Xiaoqin Zhang, Shuai Wang, Juergen Rahmel

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02029 2026-02-03 cs.AI cs.SE 76%

Canonical Intermediate Representation for LLM-based optimization problem formulation and code generation

基于LLM的优化问题建模与代码生成的规范中间表示

Zhongyuan Lyu, Shuoyu Hu, Lujie Liu, Hongxia Yang, Ming LI

机构 * The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学)

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI

AI总结 本研究提出规范中间表示(CIR)以提升LLM在复杂运营规则下的优化问题建模与代码生成能力,通过多智能体框架实现高精度建模。

Comments 41 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23753 2026-02-03 cs.LG cs.CL 62%

Anchored Supervised Fine-Tuning

锚定监督微调

He Zhu, Junyou Su, Peng Lai, Ren Ma, Wenjia Zhang, Linyi Yang, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本文提出锚定监督微调(ASFT),通过引入KL正则化解决动态微调(DFT)的稳定性问题,在数学推理、医学知识和代码生成等领域取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05266 2026-02-03 cs.AR cs.CL cs.LG 62%

Understanding and Mitigating Errors of LLM-Generated RTL Code

理解并缓解LLM生成的RTL代码错误

Jiazheng Zhang, Cheng Liu, Long Cheng, Xiaowei Li, Huawei Li

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于LLM的框架,通过检索增强生成、规则检查、多模态转换和迭代仿真调试,显著提升了RTL代码生成的准确性。

Comments Accepted by IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00190 2026-02-03 cs.AI cs.CV cs.LG 62%

From Gameplay Traces to Game Mechanics: Causal Induction with Large Language Models

从游戏行为追踪到游戏机制:利用大语言模型进行因果推理

Mohit Jiwatode, Alexander Dockhorn, Bodo Rosenhahn

机构 * Institute for Information Processing, Leibniz University Hannover, Germany(汉诺威莱布尼茨大学信息处理研究所) SDU Metaverse Lab, University of Southern Denmark, Denmark(丹麦南方大学元宇宙实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型进行因果推理,通过从游戏行为追踪中推断出视频游戏描述语言规则,以更准确地理解游戏机制。

Comments Submitted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02341 2026-02-03 cs.CL cs.AI 62%

DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning

DRIFT:从现实世界偏好学习中学习大量用户不满

Yifan Wang, Bolian Li, Junlin Wu, Zhaoxuan Tan, Zheli Liu, Ruqi Zhang, Ananth Grama, Qingkai Zeng

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 DRIFT通过利用现实世界中的用户不满信号,提升大语言模型的偏好学习性能,实现更高的任务得分和胜率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01919 2026-02-03 cs.CL 57%

From Code-Centric to Concept-Centric: Teaching NLP with LLM-Assisted "Vibe Coding"

从代码导向到概念导向:利用LLM辅助的“Vibe编码”教授NLP

Hend Al-Khalifa

机构 * College of Computer and Information Sciences(计算机与信息科学学院) King Saud University(沙特国王大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出利用LLM辅助的

Comments Accepted in The Seventh Workshop on Teaching Natural Language Processing (Teaching NLP @ EACL2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07477 2026-02-03 cs.AI 57%

JudgeFlow: Agentic Workflow Optimization via Block Judge

JudgeFlow: 通过块判断实现代理工作流优化

Zihan Ma, Zhikai Zhao, Chuanbo Hua, Federico Berto, Jinkyoo Park

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 JudgeFlow通过引入可配置的逻辑块和专用判断模块,实现代理工作流的高效优化,提升样本效率和可解释性,并在数学推理和代码生成任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00704 2026-02-03 cs.LG 57%

LocalV: Exploiting Information Locality for IP-level Verilog Generation

LocalV: 利用信息局部性进行IP级Verilog生成

Hanqi Lyu, Di Huang, Yaoyu Zhu, Kangcheng Liu, Bohan Dou, Chongxiao Li, Pengwei Jin, Shuyao Cheng, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen

机构 * University of Science(科学大学) SKL of Processors, Institute of Computing Technology, CAS(处理器研究所,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 LocalV通过利用模块化硬件设计中的信息局部性,解决IP级Verilog生成中的长文档处理、长代码生成和调试挑战,实现更高的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17075 2026-02-03 cs.AI 57%

LoRA is All You Need for Safety Alignment of Reasoning LLMs

LoRA是实现推理LLM安全对齐的全部需求

Yihao Xue, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 LoRA通过在拒绝数据集上进行有监督微调,有效解决推理LLM的安全对齐问题,同时保持推理性能,适用于多种模型和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC 57%

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26313 2026-02-03 cs.CL 57%

One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient

单个标记回滚:通过策略梯度引导大语言模型的监督微调

Rui Ming, Haoyuan Wu, Shoubo Hu, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) ChatEDA Tech(ChatEDA技术公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 通过策略梯度引导监督微调,单个标记回滚(OTR)在多个基准测试中优于标准SFT,展示了on-policy数据对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01952 2026-02-03 cs.DB 50%

SQLAgent: Learning to Explore Before Generating as a Data Engineer

SQLAgent: 作为数据工程师在生成前学习探索

Wenjia Jiang, Yiwei Wang, Boyan Han, Joey Tianyi Zhou, Chi Zhang

专题命中 代码生成 :code generation(abstract)

AI总结 SQLAgent通过两阶段框架实现数据库探索与查询生成解耦,利用蒙特卡洛树搜索策略构建知识库,并通过双代理系统提升SQL查询准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2602.00409 2026-02-03 cs.SE 79%

Are Coding Agents Generating Over-Mocked Tests? An Empirical Study

编码代理是否生成过度的模拟测试?一项实证研究

Andre Hora, Romain Robbes

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文研究了编码代理生成测试中模拟的使用情况,发现代理更倾向于修改测试并添加模拟,同时指出模拟测试可能更容易自动生成但验证效果较弱。

Comments Accepted for publication at MSR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22414 2026-02-03 cs.SE 74%

AutoCodeSherpa: Symbolic Explanations in AI Coding Agents

AutoCodeSherpa: AI 编程代理中的符号解释

Sungmin Kang, Haifeng Ruan, Abhik Roychoudhury

专题命中 软件智能体 :coding agent(title);分类 cs.SE

AI总结 AutoCodeSherpa通过符号公式提供软件问题解释,提升自动化修复和程序分析的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02361 2026-02-03 cs.SE cs.AI 62%

SWE-Universe: Scale Real-World Verifiable Environments to Millions

SWE-Universe: 将现实可验证环境扩展至百万级

Mouxiang Chen, Lei Zhang, Yunlong Feng, Xuwu Wang, Wenting Zhao, Ruisheng Cao, Jiaxi Yang, Jiawei Chen, Mingze Li, Zeyao Ma, Hao Ge, Zongmeng Zhang, Zeyu Cui, Dayiheng Liu, Jingren Zhou, Jianling Sun, Junyang Lin, Binyuan Hui

机构 * Qwen Team, Alibaba Group(通义团队,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 SWE-Universe通过高效框架构建百万级现实可验证环境,提升编码代理训练效果。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00164 2026-02-03 cs.SE cs.AI 62%

Why Are AI Agent Involved Pull Requests (Fix-Related) Remain Unmerged? An Empirical Study

为何AI代理参与的修复相关拉取请求仍未合并?一项实证研究

Khairul Alam, Saikat Mondal, Banani Roy

机构 * University of Saskatchewan, Canada(萨斯喀彻温大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过实证研究揭示了AI代理生成的修复相关PRs合并失败的主要原因,指出测试用例失败和先前问题解决是主要障碍,为AI与人类协作改进提供方向。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23158 2026-02-03 stat.ME 50%

Active Learning with Adaptive Non-Stationary Kernel for Continuous-Fidelity Surrogate Models

基于自适应非平稳核的主动学习用于连续保真度替代模型

Romain Boutelet, Chih-Li Sung

专题命中 软件智能体 :repository(abstract)

AI总结 本文提出了一种基于自适应非平稳核的主动学习方法,用于改进连续保真度替代模型的预测精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2602.00129 2026-02-03 cs.LG cs.SE 84%

Monte Carlo Tree Search for Execution-Guided Program Repair with Large Language Models

基于大语言模型的执行引导程序修复的蒙特卡罗树搜索

Yixuan Liang

机构 * Illinois Institute of Technology Chicago, USA(伊利诺伊理工学院芝加哥分校)

专题命中 程序修复 :program repair(title,abstract);repository(abstract);分类 cs.SE、cs.LG

AI总结 CodePilot结合MCTS和大语言模型,通过执行反馈引导程序修复,实现高效的问题解决。

Comments 10 pages, 5 figures. Submitted to a conference workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01892 2026-02-03 cs.LG cs.AI cs.SE cs.SY eess.SY 67%

DiTOX: Fault Detection and Localization in the ONNX Optimizer

DiTOX:ONNX优化器中的故障检测与定位

Nikolaos Louloudakis, Ajitha Rajan

机构 * University of Edinburgh(爱丁堡大学)

专题命中 程序修复 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 DiTOX通过差分测试和故障定位技术,发现ONNX优化器中15个问题,揭示了优化器在不同任务中的正确性问题。

Comments 13 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2602.01285 2026-02-03 cs.LG cs.AI stat.ML 62%

Multi-LLM Adaptive Conformal Inference for Reliable LLM Responses

多LLM自适应置信推理用于可靠的LLM响应

Kangjun Noh, Seongchan Lee, Ilmun Kim, Kyungwoo Song

机构 * Department of Applied Statistics and Data Science, Yonsei University(应用统计与数据科学系,延世大学) Department of Mathematical Sciences, KAIST(数学科学系,韩国科学技术院)

专题命中 测试生成 :repository(abstract);分类 cs.AI、cs.LG

AI总结 多LLM自适应置信推理通过集成生成更准确的事实性分数,提升高风险领域中LLM响应的可靠性和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 9 篇

2601.03708 2026-02-03 cs.PL cs.AI 81%

MHRC-Bench: A Multilingual Hardware Repository-Level Code Completion benchmark

MHRC-Bench: 一个多语言硬件仓库级代码补全基准

Qingyun Zou, Jiahao Cui, Nuo Chen, Bingsheng He, Weng-Fai Wong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 代码评测 :repository(title,abstract);分类 cs.AI、cs.PL

AI总结 MHRC-Bench是首个多语言硬件仓库级代码补全基准,涵盖三种硬件设计编码风格,通过代码结构和硬件导向语义标签进行补全任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13853 2026-02-03 cs.CL cs.AI cs.DB cs.HC 62%

BenchPress: A Human-in-the-Loop Annotation System for Rapid Text-to-SQL Benchmark Curation

BenchPress:一种用于快速文本到SQL基准定制的人机协作标注系统

Fabian Wenz, Omar Bouattour, Devin Yang, Justin Choi, Cecil Gregg, Nesime Tatbul, Çağatay Demiralp

机构 * TU Munich(慕尼黑技术大学) MIT(麻省理工学院) Intel Labs(英特尔实验室) AWS AI Labs(亚马逊AI实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 BenchPress通过人机协作系统加速特定领域文本到SQL基准的创建,结合LLM生成与人类验证提升标注准确性与基准可靠性。

Comments CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02345 2026-02-03 cs.SE 57%

A Task-Level Evaluation of AI Agents in Open-Source Projects

对开源项目中AI代理的任务级评估

Shojibur Rahman, Md Fazle Rabbi, Minhaz Zibran

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 本文评估了五个AI代理在开源项目中的表现,发现Codex在PR接受率上表现优异,而Copilot在审查讨论量上领先,但提交质量因任务类型而异。

Comments 5 pages, accepted at MSR Mining Challenge 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01714 2026-02-03 cs.CL 57%

MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark

MedAraBench:大规模阿拉伯语医学问答数据集和基准测试

Mouath Abu-Daoud, Leen Kharouf, Omar El Hajj, Dana El Samad, Mariam Al-Omari, Jihad Mallat, Khaled Saleh, Nizar Habash, Farah E. Shamout

机构 * Engineering Division, New York University Abu Dhabi(纽约大学阿布扎克分校工程系) Cleveland Clinic Abu Dhabi(阿布扎克克利夫兰诊所) Science Division, New York University Abu Dhabi(纽约大学阿布扎克分校科学系)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 MedAraBench是一个大规模阿拉伯语医学问答数据集,旨在通过提供多样化的医学领域数据来提升大型语言模型的多语言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19110 2026-02-03 cs.CL 57%

APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries

APE-Bench: 评估形式数学库中的自动化证明工程

Huajian Xin, Luming Li, Xiaoran Jin, Jacques Fleuriot, Wenda Li

机构 * University of Edinburgh(爱丁堡大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 APE-Bench提出了一种系统性评估仓库级证明工程的框架,通过双验证机制评估语法编译和语义要求满足,并提供开源工具进行标准化评估和公平比较。

详情

展开后加载摘要…

URL PDF HTML 收藏