arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-23 至 2025-12-23 共收录 22 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2512.19122 2025-12-23 cs.SE cs.CL 81%

BanglaForge: LLM Collaboration with Self-Refinement for Bangla Code Generation

BanglaForge: 通过自反思的LLM协作实现孟加拉语代码生成

Mahir Labib Dihan, Sadif Ahmed, Md Nafiu Rahman

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 BanglaForge通过双模型协作与自反思技术,实现低资源孟加拉语代码生成,达到84.00%的Pass@1准确率。

Comments Accepted at BLP Workshop @ IJCNLP-AACL 2025. Code is available at https://github.com/mahirlabibdihan/BanglaForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18131 2025-12-23 cs.SE cs.AI 81%

Holistic Evaluation of State-of-the-Art LLMs for Code Generation

全方位评估最新大型语言模型在代码生成中的表现

Le Zhang, Suresh Kothari

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 本研究评估了六个最新大型语言模型在代码生成中的表现,发现DeepSeek-R1和GPT-4.1在正确性、效率和鲁棒性方面表现最佳,强调了提示工程和人类监督的重要性。

Comments 13 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12399 2025-12-23 cs.AI 70%

A Survey of Vibe Coding with Large Language Models

基于大语言模型的Vibe编码调研

Yuyao Ge, Lingrui Mei, Zenghao Duan, Tianhao Li, Yujia Zheng, Yiwei Wang, Lexin Wang, Jiayu Yao, Tianyu Liu, Yujun Cai, Baolong Bi, Fangda Guo, Jiafeng Guo, Shenghua Liu, Xueqi Cheng

机构 * Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) Duke University(杜克大学) University of California Merced(加州大学默塞德分校) Peking University(北京大学) University of Queensland(昆士兰大学)

专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.AI

AI总结 本文调研了基于大语言模型的Vibe编码方法,系统分析了其理论基础和五个开发模型,揭示了上下文工程与协作模式对成功的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01382 2025-12-23 cs.SE cs.AI cs.LG 67%

Automatic Detection of LLM-Generated Code: A Comparative Case Study of Contemporary Models Across Function and Class Granularities

大语言模型生成代码的自动检测:对当代模型在函数和类粒度上的比较案例研究

Musfiqur Rahman, SayedHassan Khatoonabadi, Ahmad Abdellatif, Emad Shihab

机构 * Concordia University(康科迪亚大学) University of Calgary(卡尔加里大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文通过比较四个大语言模型在函数和类粒度上的代码生成能力,发现粒度效应主导模型差异,且不同模型在不同粒度上的检测性能存在显著差异。

Comments Submitted to a journal for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18567 2025-12-23 cs.SE cs.AI 62%

AI Code in the Wild: Measuring Security Risks and Ecosystem Shifts of AI-Generated Code in Modern Software

AI 代码在现实世界中的应用:衡量 AI 生成代码在现代软件中的安全风险和生态系统变化

Bin Wang, Wenjie Yu, Yilu Zhong, Hao Yu, Keke Lian, Chaohua Lu, Hongfang Zheng, Dong Zhang, Hui Li

机构 * Peking University(北京大学) Tencent(腾讯)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了AI生成代码在现实世界中的安全风险和生态系统变化,通过大规模实证分析揭示了AI代码在软件开发中的分布、安全影响及人类与AI协作中的安全机制。

Comments https://mp.weixin.qq.com/s/sI_LKPnA-BeCVYr9Ko4sqg https://github.com/Narwhal-Lab/aicode-in-the-wild-security-risk-report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19228 2025-12-23 cs.AI 57%

Generation of Programmatic Rules for Document Forgery Detection Using Large Language Models

利用大语言模型生成文档伪造检测的程序规则

Valentin Schmidberger, Manuel Eberhardinger, Setareh Maghsudi, Johannes Maucher

机构 * Stuttgart Media University(斯图加特媒体大学) Ruhr-University Bochum(鲁尔大学波恩)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文利用大语言模型生成文档伪造检测的规则,通过微调策略在受限硬件上实现高效验证程序。

Comments Accepted at ICMLA 2025, the first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2504.14757 2025-12-23 cs.SE cs.AI 73%

SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs

SWE-Synth:合成可验证的bug修复数据以使大语言模型能够解决现实中的bug

Minh V. T. Pham, Huy N. Phan, Hoang N. Phan, Cuong Le Chi, Tien N. Nguyen, Nghi D. Q. Bui

机构 * FPT Software AI Center, Viet Nam(越南FPT软件AI中心) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Texas at Dallas, US(美国德克萨斯大学达拉斯分校)

专题命中 软件智能体 :program repair(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 SWE-Synth通过合成可验证的bug修复数据集,提升大语言模型在解决现实bug中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02864 2025-12-23 cs.NE cs.AI math.CA math.CO math.MG 57%

Mathematical exploration and discovery at scale

大规模数学探索与发现

Bogdan Georgiev, Javier Gómez-Serrano, Terence Tao, Adam Zsolt Wagner

机构 * Google DeepMind(谷歌DeepMind) Department of Mathematics, Brown University(布朗大学数学系) Institute for Advanced Study(高级研究院) UCLA Department of Mathematics(加州大学洛杉矶分校数学系)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 AlphaEvolve通过进化搜索发现数学构造,提升数学问题解决效率

Comments 81 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05904 2025-12-23 cs.CV 50%

Binary Event-Driven Spiking Transformer

二进制事件驱动脉冲变压器

Honglin Cao, Zijian Zhou, Wenjie Wei, Ammar Belatreche, Yu Liang, Dehao Zhang, Malu Zhang, Yang Yang, Haizhou Li

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Northumbria University(北umbria大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :repository(abstract)

AI总结 本文提出二进制事件驱动脉冲变压器(BESTformer),通过二值化技术减少计算和存储需求,结合耦合信息增强方法缓解性能下降,实现高效且高性能的脉冲神经网络模型。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2506.18403 2025-12-23 cs.SE cs.AI 62%

The Debugging Decay Index: Rethinking Debugging Strategies for Code LLMs

调试衰减指数:重新思考代码LLM的调试策略

Muntasir Adnan, Carlos C. N. Kuhn

机构 * Open Source Institute(开源研究所) University of Canberra(堪培拉大学)

专题命中 程序修复 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出调试衰减指数(DDI)框架,通过战略重置方法优化代码生成系统的调试策略,揭示AI调试的局限性并提升迭代生成效率。

Journal ref Sci Rep 15, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 4 篇

2512.10713 2025-12-23 cs.SE cs.AI 62%

PACIFIC: a framework for generating benchmarks to check Precise Automatically Checked Instruction Following In Code

PACIFIC:用于检查精确自动指令遵循的代码基准生成框架

Itay Dreyfuss, Antonio Abu Nassar, Samuel Ackerman, Axel Ben David, Eitan Farchi, Rami Katan, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 PACIFIC框架通过生成具有明确预期输出的基准,评估LLM在代码指令遵循和dry运行能力上的表现,提供了一种抗污染且可扩展的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19424 2025-12-23 cs.CL 57%

CodeSimpleQA: Scaling Factuality in Code Large Language Models

CodeSimpleQA: 在代码大语言模型中提升事实性

Jian Yang, Wei Zhang, Yizhi Li, Shawn Guo, Haowen Wang, Aishan Liu, Ge Zhang, Zili Wang, Zhoujun Li, Xianglong Liu, Weifeng Lv

机构 * Beihang University(北航大学) Manchester(曼彻斯特) M-A-P StepFun

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 CodeSimpleQA通过构建双语基准测试和后训练框架,提升代码大语言模型在编程知识事实准确性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18456 2025-12-23 cs.CR cs.AI 57%

SoK: Understanding (New) Security Issues Across AI4Code Use Cases

SoK:理解(新的)AI4Code使用案例中的安全问题

Qilong Wu, Taoran Li, Tianyang Zhou, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文通过调查AI4Code在三个核心应用中的安全问题,指出基准测试偏见、数据泄露和对抗鲁棒性不足等挑战,并提出安全默认实践、全面检测基准和翻译增强语言等改进方向。

Comments 39 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11361 2025-12-23 cs.CL 57%

VLDBench Evaluating Multimodal Disinformation with Regulatory Alignment

VLDBench:评估具有监管对齐的多模态虚假信息

Shaina Raza, Ashmal Vayani, Aditya Jain, Aravind Narayanan, Vahid Reza Khazaie, Syed Raza Bashir, Elham Dolatabadi, Gias Uddin, Christos Emmanouilidis, Rizwan Qureshi, Mubarak Shah

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。

Comments Accepted in Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 5 篇

2512.18865 2025-12-23 cs.CV cs.CL cs.LG 62%

Application of deep learning approaches for medieval historical documents transcription

深度学习方法在中世纪历史文献转录中的应用

Maksym Voloshchuk, Bohdana Zarembovska, Mykola Kozlenko

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.LG

AI总结 本文提出深度学习方法用于中世纪拉丁文文献的转录,通过改进的模型流程提升识别效率,并提供了实验结果与数据集开发细节。

Comments 15 pages, 15 figures, 4 tables. Originally published by CEUR Workshop Proceedings (CEUR-WS.org, ISSN 1613-0073), available: https://ceur-ws.org/Vol-4133/S_05_Kozlenko.pdf

Journal ref Proceedings of the 9th International Scientific and Practical Conference Applied Information Systems and Technologies in the Digital Society (AISTDS 2025), in CEUR Workshop Proceedings, vol. 4133, Kyiv, Ukraine, Oct. 1, 2025, pp. 45-60

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19524 2025-12-23 cs.LG cs.NA math.NA 57%

Initialization of a Polyharmonic Cascade, Launch and Testing

多项式谐波级联的初始化,启动与测试

Yuriy N. Bakhvalov

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文提出了一种基于超八面体对称星座的多项式谐波级联初始化方法,实现了高效稳定训练并在多个数据集上展示了优异的性能。

Comments Part 4 of 4 in the "Polyharmonic Cascade" cycle. Contains initialization algorithms and experimental results (MNIST, HIGGS, Epsilon). Previous papers: arXiv:2512.12731, arXiv:2512.16718, arXiv:2512.17671. Source code: https://github.com/xolod7/polyharmonic-cascade

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18670 2025-12-23 cs.LG 57%

Demonstration-Guided Continual Reinforcement Learning in Dynamic Environments

动态环境中的演示引导持续强化学习

Xue Yang, Michael Schukat, Junlin Lu, Patrick Mannion, Karl Mason, Enda Howley

机构 * School of Computer Science, University of Galway(Galway大学计算机科学学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本研究提出演示引导持续强化学习(DGCRL),通过外部演示库指导智能体探索与适应,提升动态环境中的学习效率和知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19112 2025-12-23 math.AG math.AC math.CO 50%

The geometric Merkurjev-Panin Conjecture for the Cox category

Cox范畴的几何Merkurjev-Panin猜想

Daniel Erman, Andrew Hanlon, Gaku Liu, Hailun Zheng

专题命中 仓库级理解 :repository(abstract)

AI总结 本文证明了Cox范畴中几何Merkurjev-Panin猜想的强版本成立,揭示了该范畴在研究代数簇同调代数中的重要性。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05491 2025-12-23 cs.CV cs.CR 50%

One Perturbation is Enough: On Generating Universal Adversarial Perturbations against Vision-Language Pre-training Models

一次扰动就足够:针对视觉-语言预训练模型生成通用对抗扰动

Hao Fang, Jiawei Kong, Wenbo Yu, Bin Chen, Jiawei Li, Hao Wu, Shutao Xia, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出C-PGC方法,通过对比学习生成通用对抗扰动,攻击视觉-语言预训练模型的多模态对齐能力。

Comments Accepted by ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 2 篇

2512.18182 2025-12-23 cs.SE 57%

Understanding Typing-Related Bugs in Solidity Compiler

理解Solidity编译器中的输入相关错误

Lantian Li, Yue Pan, Dan Wang, Jingwen Wu, Zhongxing Yu

专题命中 程序分析与验证 :repository(abstract);分类 cs.SE

AI总结 本文首次系统研究Solidity编译器中的输入相关错误,通过分析146个已修复错误,揭示其分布模式和特征,并总结12项核心发现。

Comments 37 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18160 2025-12-23 cs.AI 57%

Propose, Solve, Verify: Self-Play Through Formal Verification

提出、解决、验证:通过形式验证进行自我对战

Alex Wilf, Pranjal Aggarwal, Bryan Parno, Daniel Fried, Louis-Philippe Morency, Paul Pu Liang, Sean Welleck

机构 * Carnegie Mellon University, School of Computer Science(卡内基梅隆大学计算机科学学院) MIT(麻省理工学院)

专题命中 程序分析与验证 :code generation(abstract);分类 cs.AI

AI总结 通过形式验证的自我对战框架PSV,在代码生成中显著提升了模型性能,展示了形式验证和难度感知生成对自我对战的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他AI编程 1 篇

2512.19215 2025-12-23 cs.SE 79%

Semantically-Equivalent Transformations-Based Backdoor Attacks against Neural Code Models: Characterization and Mitigation

基于语义等价变换的神经代码模型后门攻击:特性与缓解

Junyao Ye, Zhen Li, Xi Tang, Shouhuai Xu, Deqing Zou, Zhongsheng Yuan

专题命中 其他AI编程 :code model(title,abstract);分类 cs.SE

AI总结 本文提出基于语义等价变换的后门攻击方法,通过低频代码变换生成隐蔽触发器,实验显示其高成功率和隐蔽性,揭示了现有防御措施的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏