arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12194 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1744 篇

2601.15728 2026-01-26 cs.AI cs.SE 62%

Benchmarking Text-to-Python against Text-to-SQL: The Impact of Explicit Logic and Ambiguity

对文本到Python与文本到SQL的基准测试:显式逻辑和歧义的影响

Hangle Hu, Chenyu Hou, Bin Cao, Ruizhe Li

机构 * Zhejiang University of Technology(浙江工业大学) University of Aberdeen(阿伯丁大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出BIRD-Python基准测试,通过逻辑完成框架解决文本到Python与SQL的性能差异问题,证明Python在分析代理中的可行性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 62%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16272 2026-01-21 cs.SE cs.AI 62%

Beyond Blind Spots: Analytic Hints for Mitigating LLM-Based Evaluation Pitfalls

超越盲区:用于缓解基于LLM评估缺陷的分析提示

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Raviv Gal, Wesam Ibraheem, Rami Katan, Alice Podolsky

机构 * Ora Nova Fandina(奥拉诺瓦·法丁纳) Eitan Farchi(埃itan·法奇) Shmulik Froimovich(什mulik·弗罗伊米奇) Raviv Gal(拉维夫·加尔) Wesam Ibraheem(韦萨姆·伊布拉希姆) Rami Katan(拉米·卡坦) Alice Podolsky(艾丽斯·波德洛斯基)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出了一种分析提示方法,通过结合LLM和分析检查器,提高代码评估的可靠性,减少LLM的盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18488 2026-01-19 cs.SE cs.AI 62%

Evaluating perturbation robustness of generative systems that use COBOL code inputs

评估使用COBOL代码输入的生成系统对扰动的鲁棒性

Samuel Ackerman, Wesam Ibraheem, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出评估使用COBOL代码输入的生成系统鲁棒性的框架,通过扰动方法和可视化工具提升系统对输入变化的鲁棒性。

Comments 16 pages (8 main, 8 appendix). Accepted to AI-SQE (ICSE, 2026): The 1st International Workshop on AI for Software Quality Evaluation: Judgment, Metrics, Benchmarks, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10496 2026-01-16 cs.SE cs.AI 62%

Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs

模型看见,模型做?基于暴露的bug-修复偏好评估

Ali Al-Kaswan, Claudio Spiess, Prem Devanbu, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) University of California at Davis(加州大学戴维斯分校)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究发现LLM在生成代码时更倾向于重复bug而非修复,暴露于bug的示例加剧了这一倾向,而修复暴露则仅有微小改进,揭示了LLM可能传播记忆错误的风险。

Comments MSR 2026 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09084 2026-01-16 cs.CL cs.LG 62%

How Many Human Judgments Are Enough? Feasibility Limits of Human Preference Evaluation

需要多少人判断?人类偏好评估的可行性极限

Wilson Y. Lee

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 研究发现人类偏好评估中,当偏好信号分散时,比例分配是最佳策略,而精心设计的基准测试能通过减少方差提高检测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07309 2026-01-14 cs.CL cs.LG 62%

PIE: Performance Interval Estimation for Free-Form Generation Tasks

PIE:用于自由形式生成任务的性能区间估计

Chi-Yang Hsu, Alexander Braylan, Yiheng Su, Matthew Lease, Omar Alonso

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 PIE提出了一种用于自由形式生成任务的性能区间估计方法,通过回归实现更准确的指标评分和校准的不确定性区间。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23367 2026-01-09 cs.LG cs.AI 62%

Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2

在Atlas A2上对OpenPangu模型进行训练后量化以实现高效部署

Yilun Luo, Huaqing Zheng, Haoqian Meng, Wenyuan Liu, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在Atlas A2上通过低比特量化提升OpenPangu模型的推理效率,实现高效CoT推理并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02404 2026-01-07 cs.CL cs.AI 62%

PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models

PCEval: 一个评估大型语言模型物理计算能力的基准

Inpyo Song, Eunji Jeon, Jangwon Lee

机构 * Department of Immersive Media Engineering(沉浸媒体工程系) Sungkyunkwan University(成均馆大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 PCEval是一个评估大型语言模型物理计算能力的基准,通过自动评估电路生成和硬件交互能力,揭示LLMs在物理布局设计中的不足。

Comments Code and Dataset available at https://github.com/Null99-Dog/PCEval-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22334 2026-01-07 cs.AI cs.CL 62%

SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence

SciEvalKit: 一个用于科学通用智能的开源评估工具包

Yiheng Wang, Yixin Chen, Shuo Li, Yifan Zhou, Bo Liu, Hengjian Gao, Jiakang Yuan, Jia Bu, Wanghan Xu, Yuhao Zhou, Xiangyu Zhao, Zhiwang Zhou, Fengxiang Wang, Haodong Duan, Songyang Zhang, Jun Yao, Han Deng, Yizhou Wang, Jiabei Xiao, Jiaqi Liu, Encheng Su, Yujie Liu, Weida Wang, Junchi Yao, Shenghe Zheng, Haoran Sun, Runmin Ma, Xiangchao Yan, Bo Zhang, Dongzhan Zhou, Shufei Zhang, Peng Ye, Xiaosong Wang, Shixiang Tang, Wenlong Zhang, Lei Bai

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 SciEvalKit是一个开源工具包,用于评估科学通用智能,涵盖科学多模态感知、推理、理解等核心能力,并提供灵活的评估流程和可定制的基准测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20159 2025-12-24 cs.SE cs.AI 62%

AXIOM: Benchmarking LLM-as-a-Judge for Code via Rule-Based Perturbation and Multisource Quality Calibration

AXIOM:通过基于规则的扰动和多源质量校准构建LLM-as-a-Judge代码评估基准

Ruiqi Wang, Xinchen Wang, Cuiyun Gao, Chun Yong Chong, Xin Xia, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Monash University Malaysia(墨尔本大学马来西亚分校) Zhejiang University(浙江大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 AXIOM通过基于规则的扰动和多源质量校准构建代码评估基准,以实现高质量代码评分的平衡分布和可靠评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10713 2025-12-23 cs.SE cs.AI 62%

PACIFIC: a framework for generating benchmarks to check Precise Automatically Checked Instruction Following In Code

PACIFIC:用于检查精确自动指令遵循的代码基准生成框架

Itay Dreyfuss, Antonio Abu Nassar, Samuel Ackerman, Axel Ben David, Eitan Farchi, Rami Katan, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 PACIFIC框架通过生成具有明确预期输出的基准,评估LLM在代码指令遵循和dry运行能力上的表现,提供了一种抗污染且可扩展的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17387 2025-12-22 cs.SE cs.CL 62%

CIFE: Code Instruction-Following Evaluation

CIFE:代码指令遵循评估

Sravani Gunnu, Shanmukha Guttula, Hima Patel

机构 * IIT Bombay(印度班加罗尔理工学院) IBM Research India(IBM印度研究)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 CIFE评估了1000个Python任务的代码生成模型,通过13类约束测试,揭示了模型在遵循开发者要求方面的不足,提出C2A分数衡量正确性与约束遵循性。

Comments 20 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05368 2025-12-19 cs.RO cs.AI cs.LG 62%

Long-Horizon Visual Imitation Learning via Plan and Code Reflection

通过计划与代码反思实现长 horizon 视觉模仿学习

Quan Chen, Chenrui Shi, Qi Chen, Yuwei Wu, Zhi Gao, Xintong Zhang, Rui Gao, Kun Wu, Yunde Jia

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science and Technology, Beijing Institute of Technology, China(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学,中国) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, China(广东机器感知与智能计算实验室,深圳MSU-BIT大学,中国) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心,中国)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过计划与代码反思模块提升长 horizon 视觉模仿学习性能,引入 LongVILBench 基准验证方法有效性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13330 2025-12-16 cs.CL cs.AI 62%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05507 2025-12-11 cs.PL cs.AI 62%

Grammar-Based Code Representation: Is It a Worthy Pursuit for LLMs?

基于语法的代码表示:对于大语言模型来说,这是否值得追求?

Qingyuan Liang, Zhao Zhang, Zeyu Sun, Zheng Lin, Qi Luo, Yueyi Xiao, Yizhou Chen, Yuqun Zhang, Haotian Zhang, Lu Zhang, Bin Chen, Yingfei Xiong

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Kuaishou Technology(快手科技) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 本文探讨了基于语法的代码表示在大语言模型中的有效性,通过实验表明其在提升代码生成准确性和区分细微代码差异方面具有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24091 2025-12-04 cs.SE cs.AI cs.PF 62%

PerfBench: Can Agents Resolve Real-World Performance Bugs?

PerfBench: 代理能否解决现实中的性能缺陷?

Spandan Garg, Roshanak Zilouchian Moghaddam, Neel Sundaresan

机构 * Microsoft Corporation(微软公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 PerfBench通过引入新的基准测试,评估代理解决性能缺陷的能力,发现现有代理在性能优化任务上表现不佳,但通过改进工具和指导可提升至20%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12286 2025-12-02 cs.AI cs.SE 62%

The SWE-Bench Illusion: When State-of-the-Art LLMs Remember Instead of Reason

SWE-Bench 的错觉:当最先进的大语言模型记住而不是推理

Shanchao Liang, Spandan Garg, Roshanak Zilouchian Moghaddam

机构 * Purdue University(普渡大学) Microsoft(微软)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文指出,SWE-Bench 的高表现可能源于记忆而非推理,通过两个诊断任务揭示模型在软件工程任务中的能力限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24616 2025-12-02 cs.CL cs.AI 62%

Eye of Judgement: Dissecting the Evaluation of Russian-speaking LLMs with POLLUX

Judgment Eye: 解剖俄罗斯语LLM评估的POLLUX

Nikita Martynov, Anastasia Mordasheva, Dmitriy Gorbetskiy, Danil Astafurov, Ulyana Isaeva, Elina Basyrova, Sergey Skachkov, Victoria Berestova, Nikolay Ivanov, Valeriia Zanina, Alena Fenogenova

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 POLLUX通过细粒度任务分类和LLM评估器,提供可解释的俄语生成模型评估方法。

Comments short version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22377 2025-12-01 cs.LG cs.AI physics.data-an 62%

A Systematic Literature Review of Spatio-Temporal Graph Neural Network Models for Time Series Forecasting and Classification

时空图神经网络模型在时间序列预测与分类中的系统文献综述

Flavio Corradini, Flavio Gerosa, Marco Gori, Carlo Lucheroni, Marco Piangerelli, Martina Zannotti

机构 * School of Science and Technology, University of Camerino(科学与技术学院,坎皮诺大学) DIISM, University of Siena(DIISM,锡耶纳大学) Syeew s.r.l.(Syeew公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了时空图神经网络在时间序列预测与分类中的应用,全面分析了不同模型的性能对比及现存挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20955 2025-11-27 cs.SE cs.AI 62%

SpaceX: Exploring metrics with the SPACE model for developer productivity

SpaceX:探索SPACE模型用于开发者生产力的度量

Sanchit Kaul, Kevin Nhu, Jason Eissayou, Ivan Eser, Victor Borup

机构 * University Of California, Davis(加州大学戴维斯分校)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SpaceX研究通过SPACE模型探索开发者生产力的多维度量,揭示负面情绪与提交频率的正相关性,并提出复合生产力分数以解决开发者效能异质性问题。

Comments Code available at https://github.com/knhu/ECS260Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07071 2025-11-21 q-fin.TR cs.AI cs.LG q-fin.CP 62%

TRADES: Generating Realistic Market Simulations with Diffusion Models

TRADES: 使用扩散模型生成逼真市场模拟

Leonardo Berti, Bardh Prenkaj, Paola Velardi

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 TRADES通过基于变换器的扩散模型生成逼真市场模拟,提升合成数据在金融任务中的应用价值。

Comments 8 pages

Journal ref ECAI 2025. Volume 413: Pages 3703 - 3710

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13998 2025-11-19 cs.SE cs.AI 62%

LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering

Jielin Qiu, Zuxin Liu, Zhiwei Liu, Rithesh Murthy, Jianguo Zhang, Haolin Chen, Shiyu Wang, Ming Zhu, Liangwei Yang, Juntao Tan, Roshan Ram, Akshara Prabhakar, Tulika Awalgaonkar, Zixiang Chen, Zhepeng Cen, Cheng Qian, Shelby Heinecke, Weiran Yao, Silvio Savarese, Caiming Xiong, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

Comments 54-pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11933 2025-11-18 cs.CL cs.LG 62%

InData: Towards Secure Multi-Step, Tool-Based Data Analysis

Karthikeyan K, Raghuveer Thirukovalluru, Bhuwan Dhingra, David Edwin Carlson

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19319 2025-11-14 cs.CL cs.AI 62%

FHIR-AgentBench: Benchmarking LLM Agents for Realistic Interoperable EHR Question Answering

Gyubok Lee, Elea Bach, Eric Yang, Tom Pollard, Alistair Johnson, Edward Choi, Yugang jia, Jong Ha Lee

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院) Verily Life Sciences(Verily 生物科技) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09748 2025-11-14 cs.CL cs.AI 62%

How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation

Muskaan Chopra, Lorenz Sparrenberg, Sarthak Khanna, Rafet Sifa

机构 * Fraunhofer IAIS - Department of Media Engineering(弗劳恩霍夫人工智能研究所-媒体工程部门) University of Bonn - Department of Computer Science(波恩大学-计算机科学系) Lamarr Institute for Machine Learning(拉马尔人工智能与机器学习研究所)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments Accepted in IEEE BigData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08896 2025-11-13 cs.CV cs.AI cs.LG 62%

Classifying Histopathologic Glioblastoma Sub-regions with EfficientNet

Sanyukta Adap, Ujjwal Baid, Spyridon Bakas

机构 * Division of Computational Pathology, Department of Pathology \& Laboratory Medicine, Indiana University School of Medicine, Indianapolis, IN, USA Indiana University Melvin Bren Simon Comprehensive Cancer Center, Indianapolis, IN, USA Department of Radiology \& Imaging Sciences, Indiana University School of Medicine, Indianapolis, IN, USA Department of Biostatistics \& Health Data Science, Indiana University School of Medicine, Indianapolis, IN, USA Department of Neurological Surgery, Indiana University School of Medicine, Indianapolis, IN, USA Department of Computer Science, Luddy School of Informatics, Computing Engineering, Indiana University, Indianapolis, IN, USA Corresponding authors: , , Equal senior authors

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02724 2025-11-13 eess.SP cs.AI cs.LG 62%

Veli: Unsupervised Method and Unified Benchmark for Low-Cost Air Quality Sensor Correction

Yahia Dalbah, Marcel Worring, Yen-Chia Hsu

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments Main content: 7 pages, 9 Figures, 3 Tables. Appendix: 4 pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20411 2025-11-05 cs.SE cs.CL 62%

SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents

Ibragim Badertdinov, Alexander Golubev, Maksim Nekrashevich, Anton Shevtsov, Simon Karasik, Andrei Andriushchenko, Maria Trofimova, Daria Litvintseva, Boris Yangel

机构 * Nebius

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments Dataset: https://huggingface.co/datasets/nebius/SWE-rebench, SWE-rebench leaderboard https://swe-rebench.com NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26101 2025-11-04 cs.CL cs.PL quant-ph 62%

QCoder Benchmark: Bridging Language Generation and Quantum Hardware through Simulator-Based Feedback

Taku Mikuriya, Tatsuya Ishigaki, Masayuki Kawarada, Shunya Minami, Tadashi Kadowaki, Yohichi Suzuki, Soshun Naito, Shunya Takata, Takumi Kato, Tamotsu Basseda, Reo Yamada, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Yokohama National University(Yokohama国立大学) CyberAgent, Inc.(CyberAgent公司) DENSO CORPORATION(DENSO公司) The University of Tokyo(东京大学) Keio University(庆应义塾大学) NTT DATA GROUP Corporation(NTT DATA集团公司) Miletos inc.(Miletos公司) University of Tsukuba(筑波大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.PL

Comments Accepted to INLG2025

详情

展开后加载摘要…

URL PDF HTML 收藏