arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-11-25 至 2025-11-25 共收录 31 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 15 篇

2503.22688 2025-11-25 cs.SE cs.AI cs.PL 85%

CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation

CodeIF-Bench: 评估大型语言模型在交互式代码生成中的指令遵循能力

Peiding Wang, Li Zhang, Fang Liu, Lin Shi, Minxiao Li, Bo Shen, An Fu

机构 * School of Computer Science & Engineering, State Key Laboratory of Complex & Critical Software Environment, Beihang University(计算机科学与工程学院、复杂与关键软件环境国家重点实验室、北京航空航天大学) School of Software, Beihang University(软件学院、北京航空航天大学) Huawei Cloud Computing Technologies Co., Ltd. China(华为云计算技术有限公司)

专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 CodeIF-Bench通过九种可验证指令评估LLMs在多轮交互中的指令遵循能力,揭示了上下文管理对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01215 2025-11-25 cs.CL cs.AI cs.PL cs.SE 83%

From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging

从代码到正确性:通过分层调试关闭代码生成的最后一公里

Yuling Shi, Songsong Wang, Chengcheng Wan, Min Wang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Davis(加州大学戴维斯分校) East China Normal University(华东师范大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出MGDebugger,一种分层调试器,通过多粒度分析提升代码生成的准确性与修复效率。

Comments Accepted to ICSE 2026. Code and data available at https://github.com/YerbaPage/MGDebugger

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07189 2025-11-25 cs.SE 79%

Secure-Instruct: An Automated Pipeline for Synthesizing Instruction-Tuning Datasets Using LLMs for Secure Code Generation

Secure-Instruct: 一种利用LLM合成指令微调数据集的自动化流程,用于安全代码生成

Junjie Li, Fazle Rabbi, Bo Yang, Song Wang, Jinqiu Yang

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 Secure-Instruct通过自动化合成安全代码示例和指令微调LLM,提升代码生成的安全性和功能性正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19422 2025-11-25 cs.SE cs.AI cs.PL 75%

SLMFix: Leveraging Small Language Models for Error Fixing with Reinforcement Learning

SLMFix:利用小型语言模型通过强化学习进行错误修复

David Jiahao Fu, Aryan Gupta, Aaron Councilman, David Grove, Yu-Xiong Wang, Vikram Adve

专题命中 代码生成 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 SLMFix通过强化学习微调小型语言模型,有效修复LLMs生成代码的语法错误,提升领域特定语言代码质量,优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11425 2025-11-25 cs.MA 71%

Tapas Are Free! Training-Free Adaptation of Programmatic Agents via LLM-Guided Program Synthesis in Dynamic Environments

Tapas Are Free! 通过LLM引导的程序合成实现动态环境下的免训练程序代理适应

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

专题命中 代码生成 :program synthesis(title)

AI总结 TAPA通过LLM引导的程序合成,在动态环境中实现免训练的程序代理适应,提升网络安全和群体智能任务的性能与可靠性。

Comments Extended version of the paper accepted at AAAI-26 Oral to comply with the AAAI camera-ready requirements with minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14299 2025-11-25 cs.AI cs.CL cs.MA 62%

DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning

DataSage: 基于外部知识检索、多角色辩论和多路径推理的多智能体协作以实现洞察发现

Xiaochuan Liu, Yuanfeng Song, Xiaoming Yin, Xing Chen

机构 * ByteDance, China(字节跳动)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 DataSage通过多智能体协作、外部知识检索和多路径推理,提升数据洞察发现的准确性和深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08426 2025-11-25 cs.CL cs.AI cs.DB 62%

Next-Generation Database Interfaces: A Survey of LLM-based Text-to-SQL

下一代数据库接口:基于大语言模型的文本到SQL调研

Zijin Hong, Zheng Yuan, Qinggang Zhang, Hao Chen, Junnan Dong, Feiran Huang, Xiao Huang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) College of Cyber Security, Jinan University(暨南大学网络安全学院)

专题命中 代码生成 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文调研了基于大语言模型的文本到SQL方法,分析了技术挑战、数据集、指标及最新进展,并讨论了未来研究方向。

Comments Accepted to IEEE TKDE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05012 2025-11-25 cs.SE cs.AI cs.HC 62%

LLMs' Reshaping of People, Processes, Products, and Society in Software Development: A Comprehensive Exploration with Early Adopters

大型语言模型对软件开发中人、过程、产品和社会的重塑:与早期采用者的综合探索

Benyamin Tabarsi, Heidi Reichert, Sam Gilson, Ally Limke, Sandeep Kuttal, Tiffany Barnes

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文通过访谈早期采用者,探讨LLMs对软件开发中人、过程、产品和社会的影响,揭示其在不同阶段的应用差异及对开发者技能的新要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18964 2025-11-25 cs.AI 57%

Synthesizing Visual Concepts as Vision-Language Programs

合成视觉概念作为视觉-语言程序

Antonia Wüst, Wolfgang Stammer, Hikaru Shindo, Lukas Helff, Devendra Singh Dhami, Kristian Kersting

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 本研究提出视觉-语言程序(VLP),结合视觉模型的感知灵活性与程序合成的系统推理能力,通过生成结构化视觉描述并编译成神经符号程序,提升复杂逻辑推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18867 2025-11-25 cs.SE 57%

VecIntrinBench: Benchmarking Cross-Architecture Intrinsic Code Migration for RISC-V Vector

VecIntrinBench: 跨架构内在代码迁移的RISC-V向量基准测试

Liutong Han, Chu Kang, Mingjie Xing, Yanjun Wu

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 VecIntrinBench是首个评估RISC-V向量扩展内在代码迁移能力的基准,包含50个函数级任务,通过标量、RVV、Arm Neon和x86内在函数进行测试,揭示LLM在代码迁移中的表现及优化方向。

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18597 2025-11-25 cs.CL 57%

Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Synthetic Tasks

迈向可信的难度评估:大型语言模型作为编程和合成任务的裁判

H. M. Shadman Tabib, Jaber Ahmed Deedar

机构 * Department of Computer Science, Bangladesh University of Engineering and Technology(计算机科学系,孟加拉国工程与技术大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在评估编程问题难度时的可靠性,发现LightGBM在准确性上显著优于GPT-4o,揭示了模型在处理数字约束方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 57%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17876 2025-11-25 cs.AI 57%

Training Emergent Joint Associations: A Reinforcement Learning Approach to Creative Thinking in Language Models

训练涌现的联合关联:一种基于强化学习的创造性思维方法用于语言模型

Mukul Singh, Ananya Singha, Aishni Parab, Pronita Mehrotra, Sumit Gulwani

机构 * Microsoft, USA(微软公司) Microsoft, India(微软公司) University of California, Los Angeles, USA(加州大学洛杉矶分校) MindAntix

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出了一种基于强化学习的框架,通过增强语言模型的关联性思维能力,提升其在故事创作、代码生成和数据可视化等任务中的原创性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17683 2025-11-25 cs.CY cs.AI 57%

Datacenters in the Desert: Feasibility and Sustainability of LLM Inference in the Middle East

沙漠中的数据中心:中东地区大型语言模型推理的可行性与可持续性

Lara Hassan, Mohamed ElZeftawy, Abdulrahman Mahmoud

机构 * Department of Computer Science(计算机科学系) MBZUAI(马斯克大学人工智能研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文研究了在中东沙漠地区部署大型语言模型推理数据中心的可行性与可持续性,通过实证分析能耗和碳足迹,评估不同地理区域的气候意识AI部署策略。

Comments 3 pages, 1 figure

Journal ref DCEE-2025@ISCA-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23535 2025-11-25 cs.SE 57%

Comparative Analysis of the Code Generated by Popular Large Language Models (LLMs) for MISRA C++ Compliance

对流行大语言模型生成的代码在MISRA C++合规性方面的比较分析

Malik Muhammad Umer

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文比较了多种大语言模型生成的C++代码在MISRA C++合规性上的表现,发现ChatGPT在合规性上表现最佳,而其他模型存在不同程度的违规问题。

Journal ref in IEEE Access, vol. 13, pp. 194815-194831, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2511.13646 2025-11-25 cs.SE cs.AI cs.CL cs.LG 70%

Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?

Live-SWE-agent: 软件工程代理能否在飞行中自我进化?

Chunqiu Steven Xia, Zhe Wang, Yan Yang, Yuxiang Wei, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 Live-SWE-agent是一种能够在运行时自主进化其自身框架的软件代理,通过解决现实软件问题实现了77.4%的解决率,优于现有所有软件代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22390 2025-11-25 cs.SE 57%

What Characteristics Make ChatGPT Effective for Software Issue Resolution? An Empirical Study of Task, Project, and Conversational Signals in GitHub Issues

哪些特征使ChatGPT在软件问题解决中有效?对GitHub问题中任务、项目和对话信号的实证研究

Ramtin Ehsani, Sakshi Pathak, Esteban Parra, Sonia Haiduc, Preetha Chatterjee

专题命中 软件智能体 :code generation(abstract);分类 cs.SE

AI总结 本文研究了ChatGPT在软件问题解决中的有效性特征,发现其在代码生成和工具推荐方面表现较好,但代码解释能力较弱,且更受欢迎的项目和经验丰富的开发者从中受益更多。

Comments Accepted for publication in Empirical Software Engineering (EMSE), 2025

Journal ref Empirical Software Engineering, 31, 22 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 3 篇

2511.18782 2025-11-25 cs.SE 79%

Summary-Mediated Repair: Can LLMs use code summarisation as a tool for program repair?

基于摘要的修复:大语言模型能否将代码摘要作为程序修复工具?

Lukas Twist

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 本研究提出基于摘要的程序修复方法,利用代码摘要作为中间步骤,通过提升修复效果来改进大语言模型在程序修复中的表现。

Comments 6 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18001 2025-11-25 cs.SE 79%

Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement

通过故障性令牌定位和质量感知补丁细化增强自动程序修复

Jiaolong Kong, Xiaofei Xie, Yiheng Xiong, Yuekun Wang, Jian Wang

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 TokenRepair通过内部反思定位潜在故障令牌并结合质量感知的外部反馈,提升自动程序修复的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01971 2025-11-25 cs.SE 79%

ContrastRepair: Enhancing Conversation-Based Automated Program Repair via Contrastive Test Case Pairs

ContrastRepair: 通过对比测试用例对增强基于对话的自动程序修复

Jiaolong Kong, Mingfei Cheng, Xiaofei Xie, Shangqing Liu, Xiaoning Du, Qi Guo

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 ContrastRepair通过对比测试对提升基于对话的自动程序修复效果,显著优于现有方法。

Journal ref ACM Trans. Softw. Eng. Methodol., 34(8), Article 216, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2411.02462 2025-11-25 cs.SE cs.AI cs.LG 82%

Parameter-Efficient Fine-Tuning of Large Language Models for Unit Test Generation: An Empirical Study

大型语言模型参数高效微调用于单元测试生成:一项实证研究

André Storhaug, Jingyue Li

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 测试生成 :unit test generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文通过实证研究探讨了大型语言模型在单元测试生成中的参数高效微调方法,发现LoRA在某些情况下性能可与全量微调媲美,提示微调在成本效益上表现最佳。

Comments 26 pages, 2 figures, 6 tables, 1 listing

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 6 篇

2506.20495 2025-11-25 cs.CL cs.AI cs.IR cs.LG cs.SE 70%

ReCode: Updating Code API Knowledge with Reinforcement Learning

ReCode: 通过强化学习更新代码API知识

Haoze Wu, Yunzhi Yao, Wenhao Yu, Ningyu Zhang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 ReCode通过强化学习方法提升LLMs在动态API环境下的代码生成能力,尤其在CodeUpdateArena任务中表现优异。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19273 2025-11-25 cs.LG 57%

Scalable Bayesian Network Structure Learning Using Tsetlin Machine to Constrain the Search Space

利用Tsetlin机约束搜索空间的可扩展贝叶斯网络结构学习

Kunal Dumbre, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT University of Agder(信息与通信技术系阿格德大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出利用Tsetlin机约束搜索空间,以提高贝叶斯网络结构学习的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18966 2025-11-25 cs.AI cs.CR 57%

LLM-CSEC: Empirical Evaluation of Security in C/C++ Code Generated by Large Language Models

LLM-CSEC: 对大型语言模型生成的C/C++代码安全性的实证评估

Muhammad Usman Shahid, Chuadhry Mujeeb Ahmed, Rajiv Ranjan

机构 * Independent Researcher(独立研究者) Newcastle University(新castle大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型生成的C/C++代码安全性,发现存在大量漏洞,强调开发人员需谨慎使用此类代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17125 2025-11-25 cs.SE 57%

Large Language Model Unlearning for Source Code

大型语言模型的源代码去学习

Xue Jiang, Yihong Dong, Huangzhao Zhang, Tangxinyu Wang, Zheng Fang, Yingwei Ma, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Yongbin Li, Ge Li

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究提出PROD方法,通过精确去学习源代码中的违规片段,提升代码生成的可靠性与安全性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 57%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18249 2025-11-25 cs.SE 57%

LLM Assisted Coding with Metamorphic Specification Mutation Agent

基于元形态规范变异代理的LLM编码

Mostafijur Rahman Akhond, Gias Uddin

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CodeMetaAgent通过元形态关系驱动LLM代理,提升代码生成准确性与覆盖率,有效解决规范不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 4 篇

2503.18305 2025-11-25 cs.SE 79%

Evolving Triple Knowledge-Augmented LLMs for Code Translation in Repository Context

演化三知识增强的LLM用于仓库上下文中的代码翻译

Guangsheng Ou, Mingwei Liu, Yuxuan Chen, Xueying Du, Shengbo Wang, Zekai Zhang, Xin Peng, Zibin Zheng

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 K-Trans通过三重知识增强提升仓库上下文中的代码翻译性能,实验显示其在pass@1和CodeBLEU指标上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18604 2025-11-25 cs.RO cs.AI cs.MA 57%

An Analysis of Constraint-Based Multi-Agent Pathfinding Algorithms

基于约束的多智能体路径寻找算法分析

Hannah Lee, James D. Motes, Marco Morales, Nancy M. Amato

机构 * Parasol Lab, School of Computer Science, University of Illinois at Urbana Champaign(帕索尔实验室,计算机科学学院,伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science at Instituto Tecnológico Autónomo de México (ITAM)(墨西哥自治理工学院(ITAM)计算机科学系)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文分析了基于约束的多智能体路径寻找算法,探讨了保守型与激进型约束在不同场景下的性能差异,并提供了决策流程图以指导约束选择,同时强调了拓扑特征在多机器人运动规划中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19156 2025-11-25 cs.PF 50%

ZERNIPAX: A Fast and Accurate Zernike Polynomial Calculator in Python

ZERNIPAX:一种快速且准确的Zernike多项式计算器(Python)

Yigit Gunsur Elmacioglu, Rory Conlin, Daniel W. Dudt, Dario Panici, Egemen Kolemen

专题命中 仓库级理解 :repository(abstract)

AI总结 ZERNIPAX是一种基于Python的开源工具,利用JAX和并行计算加速Zernike多项式计算,适用于需要高精度和高效计算的科学模拟领域。

详情

展开后加载摘要…

URL PDF HTML 收藏