arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1740 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1740 篇

2601.03432 2026-01-08 cs.SE 57%

CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models

CodeEval: 一种面向代码训练大语言模型的教育性评估方法

Danny Brahman, Mohammad Mahoor

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CodeEval通过多维基准数据集和开源执行框架,针对代码训练大语言模型的评估与改进提供教育性方法。

Comments Accepted at the International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics, 2025. Will be published at ACL anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02569 2026-01-07 cs.CL 57%

LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference

LoRA-Drop:用于高效LLM推理的时序LoRA解码

Hossein Rajabzadeh, Maryam Dialameh, Chul B. Park, Il-Min Kim, Hyock Ju Kwon

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Queen’s University(皇后大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 LoRA-Drop通过时序计算计划和低秩LoRA校正,实现高效LLM推理,提升解码速度2.6倍并减少45-55%的KV缓存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00481 2026-01-05 cs.NI cs.AI 57%

MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability

MAESTRO:多智能体评估套件用于测试、可靠性与可观测性

Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini

机构 * Beihang University(北航大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 57%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24400 2026-01-01 cs.CR cs.SE 57%

SourceBroken: A large-scale analysis on the (un)reliability of SourceRank in the PyPI ecosystem

SourceBroken: 对PyPI生态系统中SourceRank可靠性的大规模分析

Biagio Montaruli, Serena Elisa Ponta, Luca Compagna, Davide Balzarotti

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 SourceBroken研究发现SourceRank在PyPI生态系统中存在可靠性问题,其未能及时反映软件包删除,导致恶意与良性软件包评分重叠,URL混淆攻击显著增加。

Comments Accpted for the 41st ACM/SIGAPP Symposium on Applied Computing (SAC '26), March 23--27, 2026, Thessaloniki, Greece

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22216 2025-12-30 cs.SE 57%

Syntax Is Not Enough: An Empirical Study of Small Transformer Models for Neural Code Repair

语法不够:小型Transformer模型在神经代码修复中的实证研究

Shaunak Samant

专题命中 代码评测 :program repair(abstract);分类 cs.SE

AI总结 本研究通过实验证明,小型Transformer模型在修复Java错误时,虽然能生成语法正确的代码,但无法达到语义正确的修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19424 2025-12-23 cs.CL 57%

CodeSimpleQA: Scaling Factuality in Code Large Language Models

CodeSimpleQA: 在代码大语言模型中提升事实性

Jian Yang, Wei Zhang, Yizhi Li, Shawn Guo, Haowen Wang, Aishan Liu, Ge Zhang, Zili Wang, Zhoujun Li, Xianglong Liu, Weifeng Lv

机构 * Beihang University(北航大学) Manchester(曼彻斯特) M-A-P StepFun

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 CodeSimpleQA通过构建双语基准测试和后训练框架,提升代码大语言模型在编程知识事实准确性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18456 2025-12-23 cs.CR cs.AI 57%

SoK: Understanding (New) Security Issues Across AI4Code Use Cases

SoK:理解(新的)AI4Code使用案例中的安全问题

Qilong Wu, Taoran Li, Tianyang Zhou, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文通过调查AI4Code在三个核心应用中的安全问题,指出基准测试偏见、数据泄露和对抗鲁棒性不足等挑战,并提出安全默认实践、全面检测基准和翻译增强语言等改进方向。

Comments 39 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11361 2025-12-23 cs.CL 57%

VLDBench Evaluating Multimodal Disinformation with Regulatory Alignment

VLDBench:评估具有监管对齐的多模态虚假信息

Shaina Raza, Ashmal Vayani, Aditya Jain, Aravind Narayanan, Vahid Reza Khazaie, Syed Raza Bashir, Elham Dolatabadi, Gias Uddin, Christos Emmanouilidis, Rizwan Qureshi, Mubarak Shah

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。

Comments Accepted in Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 57%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22821 2025-12-19 cs.SE 57%

Identifying and Mitigating API Misuse in Large Language Models

识别和缓解大语言模型中的API误用

Terry Yue Zhuo, Junda He, Jiamou Sun, Zhenchang Xing, David Lo, John Grundy, Xiaoning Du

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出Dr.Fix方法,通过分类法指导LLM自动修复生成代码中的API误用问题,提升修复精度。

Comments Accepted at IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 57%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16407 2025-12-11 cs.SE 57%

CREME: Robustness Enhancement of Code LLMs via Layer-Aware Model Editing

通过层感知模型编辑提升代码LLM的鲁棒性

Shuhan Liu, Xing Hu, Kerui Huang, Xiaohu Yang, David Lo, Xin Xia

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CREME通过识别并编辑鲁棒性敏感层,提升代码生成模型对提示扰动的鲁棒性,显著提高扰动提示下的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08998 2025-12-11 eess.IV cs.AI cs.CV 57%

DermETAS-SNA LLM: A Dermatology Focused Evolutionary Transformer Architecture Search with StackNet Augmented LLM Assistant

DermETAS-SNA LLM:一种专注于皮肤科的进化Transformer架构搜索与StackNet增强LLM助手

Nitya Phani Santosh Oruganty, Keerthi Vemula Murali, Chun-Kit Ngan, Paulo Bandeira Pinho

机构 * Data Science Program, Worcester Polytechnic Institute, Massachusetts, USA(沃斯特理工学院数据科学项目,马萨诸塞州,美国) Computer Science Department, Worcester Polytechnic Institute, Massachusetts, USA(沃斯特理工学院计算机科学系,马萨诸塞州,美国) PASE Advisory Group, New Jersey, USA(PASE顾问小组,新泽西州,美国)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 DermETAS-SNA LLM结合进化Transformer架构搜索与StackNet增强LLM,旨在提升皮肤病诊断的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08867 2025-12-10 cs.SE 57%

SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA

SimpleDevQA:在开发知识问答上评估大语言模型

Jing Zhang, Lianghong Guo, Yanlin Wang, Mingwei Liu, Jiachi Chen, Yuchi Ma, Ensheng Shi, Terry Yue Zhuo, Hongyu Zhang, Zibin Zheng

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 SimpleDevQA是一个基于真实用户对话构建的多语言基准,用于评估大语言模型在开发知识问答任务中的表现,通过三阶段流程生成2740个问答对,发现代码LLM在该任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 57%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06248 2025-12-09 cs.SE 57%

CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models

CFCEval: 评估大型语言模型生成代码的安全性方面

Cheng Cheng, Jinqiu Yang

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CFCEval通过引入MLVBench和ELRM指标,有效评估大型语言模型生成代码的质量与安全性,提升代码评估的准确性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23471 2025-12-08 cs.SE 57%

Synthesizing Performance Constraints for Evaluating and Improving Code Efficiency

为评估和提升代码效率合成性能约束

Jun Yang, Cheng-Chi Wang, Bogdan Alexandru Stoica, Kexin Pei

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 WEDGE通过生成性能压力输入,提升代码优化效果,释放PERFFORGE测试以评估未来高效代码生成方法。

Comments Accepted by Neurips 2025 (main poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04759 2025-12-05 cs.CL 57%

Challenging the Abilities of Large Language Models in Italian: a Community Initiative

挑战大型语言模型在意大利语中的能力:一项社区倡议

Malvina Nissim, Danilo Croce, Viviana Patti, Pierpaolo Basile, Giuseppe Attanasio, Elio Musacchio, Matteo Rinaldi, Federico Borazio, Maria Francis, Jacopo Gili, Daniel Scalena, Begoña Altuna, Ekhi Azurmendi, Valerio Basile, Luisa Bentivogli, Arianna Bisazza, Marianna Bolognesi, Dominique Brunato, Tommaso Caselli, Silvia Casola, Maria Cassese, Mauro Cettolo, Claudia Collacciani, Leonardo De Cosmo, Maria Pia Di Buono, Andrea Esuli, Julen Etxaniz, Chiara Ferrando, Alessia Fidelangeli, Simona Frenda, Achille Fusco, Marco Gaido, Andrea Galassi, Federico Galli, Luca Giordano, Mattia Goffetti, Itziar Gonzalez-Dios, Lorenzo Gregori, Giulia Grundler, Sandro Iannaccone, Chunyang Jiang, Moreno La Quatra, Francesca Lagioia, Soda Marem Lo, Marco Madeddu, Bernardo Magnini, Raffaele Manna, Fabio Mercorio, Paola Merlo, Arianna Muti, Vivi Nastase, Matteo Negri, Dario Onorati, Elena Palmieri, Sara Papi, Lucia Passaro, Giulia Pensa, Andrea Piergentili, Daniele Potertì, Giovanni Puccetti, Federico Ranaldi, Leonardo Ranaldi, Andrea Amelio Ravelli, Martina Rosola, Elena Sofia Ruzzetti, Giuseppe Samo, Andrea Santilli, Piera Santin, Gabriele Sarti, Giovanni Sartor, Beatrice Savoldi, Antonio Serino, Andrea Seveso, Lucia Siciliani, Paolo Torroni, Rossella Varvara, Andrea Zaninello, Asya Zanollo, Fabio Massimo Zanzotto, Kamyar Zeinalipour, Andrea Zugarini

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 CALAMITA是一项针对意大利语的社区驱动基准测试项目,通过多样化任务和统一评估流程,系统评估大型语言模型的能力,为其他语言提供评估范例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11059 2025-12-03 cs.SE 57%

Defects4C: Benchmarking Large Language Model Repair Capability with C/C++ Bugs

Defects4C:利用C/C++漏洞基准测试大语言模型的修复能力

Jian Wang, Xiaofei Xie, Qiang Hu, Shangqing Liu, Jiongchi Yu, Jiaolong Kong, Yi Li

专题命中 代码评测 :program repair(abstract);分类 cs.SE

AI总结 Defects4C通过提供高质量C/C++漏洞基准测试,评估大语言模型在修复C/C++程序中的有效性,揭示当前技术的局限性并推动未来研究。

Comments ASE-2025 main research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01735 2025-12-02 cs.LG 57%

Automating modeling in mechanics: LLMs as designers of physics-constrained neural networks for constitutive modeling of materials

力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模

Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Christian Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) Helmholtz-Zentrum Hereon(海德堡中心) Hamburg University of Technology(汉堡技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03665 2025-12-02 cs.DC cs.AI 57%

LLM & HPC:Benchmarking DeepSeek's Performance in High-Performance Computing Tasks

LLM与HPC:在高性能计算任务中评估DeepSeek的性能

Noujoud Nader, Patrick Diehl, Steve Brandt, Hartmut Kaiser

机构 * Center of Computation and Technology(计算与技术中心) Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文评估了DeepSeek在高性能计算任务中生成代码的能力,发现其在扩展性和执行效率上逊于GPT-4。

Comments 9 pages, 2 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00215 2025-12-02 cs.SE 57%

Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation

解析LLM推理轨迹中的错误:对代码执行模拟的实证研究

Mohammad Abdollahi, Khandaker Rifah Tasnia, Soumit Kanti Saha, Jinqiu Yang, Song Wang, Hadi Hemmati

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究通过实证分析揭示LLM推理轨迹中的错误类型,开发了九类错误分类体系,并展示工具增强推理可有效提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21380 2025-11-27 cs.SE 57%

Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions

多智能体系统在软件工程数据集适应中的应用:能力、限制与未来方向

Jingyi Chen, Xiaoyan Guo, Songqiang Chen, Shing-Chi Cheung, Jiasi Shen

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文研究了多智能体系统在软件工程数据集适应中的能力与限制,发现提示干预能显著提升适应效果,为未来更可靠的智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01658 2025-11-27 cs.CL 57%

A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency

对大型语言模型推理引擎的综述:优化与效率的视角

Sihyeong Park, Sungryeol Jeon, Chaelyn Lee, Seokhun Jeon, Byung-Soo Kim, Jemin Lee

机构 * Korea Electronics Technology Institute(韩国电子技术研究所) Electronics and Telecommunications Research Institute(电子电信研究院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型推理引擎的优化与效率,评估了25种开源和商用引擎,探讨了其设计目标及生态系统成熟度,并提供未来研究方向和公开存储库。

Comments Under review; 106 pages; 46 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17432 2025-11-26 cs.CV cs.CL 57%

Video Understanding with Large Language Models: A Survey

利用大语言模型进行视频理解:综述

Yolo Y. Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, Ali Vosoughi, Chao Huang, Zeliang Zhang, Pinxin Liu, Mingqian Feng, Feng Zheng, Jianguo Zhang, Ping Luo, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。

Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19273 2025-11-25 cs.LG 57%

Scalable Bayesian Network Structure Learning Using Tsetlin Machine to Constrain the Search Space

利用Tsetlin机约束搜索空间的可扩展贝叶斯网络结构学习

Kunal Dumbre, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT University of Agder(信息与通信技术系阿格德大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出利用Tsetlin机约束搜索空间,以提高贝叶斯网络结构学习的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18966 2025-11-25 cs.AI cs.CR 57%

LLM-CSEC: Empirical Evaluation of Security in C/C++ Code Generated by Large Language Models

LLM-CSEC: 对大型语言模型生成的C/C++代码安全性的实证评估

Muhammad Usman Shahid, Chuadhry Mujeeb Ahmed, Rajiv Ranjan

机构 * Independent Researcher(独立研究者) Newcastle University(新castle大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型生成的C/C++代码安全性,发现存在大量漏洞,强调开发人员需谨慎使用此类代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17125 2025-11-25 cs.SE 57%

Large Language Model Unlearning for Source Code

大型语言模型的源代码去学习

Xue Jiang, Yihong Dong, Huangzhao Zhang, Tangxinyu Wang, Zheng Fang, Yingwei Ma, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Yongbin Li, Ge Li

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究提出PROD方法,通过精确去学习源代码中的违规片段,提升代码生成的可靠性与安全性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 57%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏