arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1740 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1740 篇

2506.23128 2025-07-01 cs.AI 57%

Are Large Language Models Capable of Deep Relational Reasoning? Insights from DeepSeek-R1 and Benchmark Comparisons

Chi Chiu So, Yueyue Sun, Jun-Min Wang, Siu Pang Yung, Anthony Wai Keung Loh, Chun Pong Chau

机构 * School of Professional Education and Executive Development(专业教育与执行发展学院) The Hong Kong Polytechnic University(香港理工大学) School of Mathematics and Statistics(数学与统计学学院) Beijing Institute of Technology(北京理工大学) Department of Mathematics(数学系) The University of Hong Kong(香港大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 10 pages, 0 figures, accepted by 2025 IEEE international conference on artificial intelligence testing (AITest)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08809 2025-06-25 cs.SD cs.AI eess.AS 57%

Are We There Yet? A Brief Survey of Music Emotion Prediction Datasets, Models and Outstanding Challenges

Jaeyong Kang, Dorien Herremans

机构 * Information Systems Technology and Design Pillar(信息系统技术与设计学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

Journal ref IEEE Transactions on Affective Computing (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17959 2025-06-24 cs.AI 57%

medicX-KG: A Knowledge Graph for Pharmacists' Drug Information Needs

Lizzy Farrugia, Lilian M. Azzopardi, Jeremy Debattista, Charlie Abela

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05692 2025-06-23 cs.CR cs.AI 57%

SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code

Xinghang Li, Jingzhe Ding, Chao Peng, Bing Zhao, Xiang Gao, Hongwan Gao, Xinchen Gu

专题命中 代码评测 :code generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14074 2025-06-18 cs.LG cs.AR 57%

Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification

Nathaniel Pinckney, Chenhui Deng, Chia-Tung Ho, Yun-Da Tsai, Mingjie Liu, Wenfei Zhou, Brucek Khailany, Haoxing Ren

机构 * NVIDIA

专题命中 代码评测 :code generation(abstract);分类 cs.LG

Comments 16 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10376 2025-06-13 cs.SE cs.HC 57%

MLLM-Based UI2Code Automation Guided by UI Layout Information

Fan Wu, Cuiyun Gao, Shuqing Li, Xin-Cheng Wen, Qing Liao

专题命中 代码评测 :code generation(abstract);分类 cs.SE

Comments Accepted by the 34th International Symposium on Software Testing and Analysis (ISSTA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10128 2025-06-13 cs.CV cs.LG 57%

ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs

Xiyao Wang, Zhengyuan Yang, Chao Feng, Yongyuan Liang, Yuhang Zhou, Xiaoyu Liu, Ziyi Zang, Ming Li, Chung-Ching Lin, Kevin Lin, Linjie Li, Furong Huang, Lijuan Wang

机构 * University of Maryland College Park(马里兰大学学院市分校) Microsoft(微软) University of Michigan(密歇根大学) Cardiff University(卡迪夫大学)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13572 2025-06-13 cs.AR cs.CR cs.LG 57%

VeriContaminated: Assessing LLM-Driven Verilog Coding for Data Contamination

Zeng Wang, Minghao Shao, Jitendra Bhandari, Likhitha Mankali, Ramesh Karri, Ozgur Sinanoglu, Muhammad Shafique, Johann Knechtel

专题命中 代码评测 :code generation(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11050 2025-06-13 cs.SE 57%

An Empirical Evaluation of Pre-trained Large Language Models for Repairing Declarative Formal Specifications

Mohannad Alhanahnah, Md Rashedul Hasan, Lisong Xu, Hamid Bagheri

专题命中 代码评测 :program repair(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07964 2025-06-10 cs.CV cs.AI 57%

SlideCoder: Layout-aware RAG-enhanced Hierarchical Slide Generation from Design

Wenxin Tang, Jingyu Xiao, Wenxuan Jiang, Xi Xiao, Yuhang Wang, Xuxin Tang, Qing Li, Yuehe Ma, Junliang Liu, Shisong Tang, Michael R. Lyu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Northeastern University(东北大学) Southwest University(西南大学) Kuaishou Technology(快手科技) Peng Cheng Laboratory(鹏城实验室) BNU-HKBU United International College(北京师范大学-香港 Baptist University联合国际学院) Dalian Maritime University(大连海事大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19532 2025-06-10 cs.DM cs.LG 57%

Differentiable Quadratic Optimization For The Maximum Independent Set Problem

Ismail Alkhouri, Cedric Le Denmat, Yingjie Li, Cunxi Yu, Jia Liu, Rongrong Wang, Alvaro Velasquez

专题命中 代码评测 :repository(abstract);分类 cs.LG

Journal ref International Conference on Machine Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04894 2025-06-06 cs.CL 57%

ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests

Shiyi Xu, Yiwen Hu, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03546 2025-06-05 cs.RO cs.AI cs.MA 57%

From Virtual Agents to Robot Teams: A Multi-Robot Framework Evaluation in High-Stakes Healthcare Context

Yuanchen Bai, Zijian Ding, Angelique Taylor

机构 * Cornell University(康奈尔大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00296 2025-06-03 cs.SE 57%

CRScore++: Reinforcement Learning with Verifiable Tool and AI Feedback for Code Review

Manav Nitin Kapadnis, Atharva Naik, Carolyn Rose

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03854 2025-06-02 cs.CL 57%

Vision-Language Models Struggle to Align Entities across Modalities

Iñigo Alonso, Gorka Azkune, Ander Salaberria, Jeremy Barnes, Oier Lopez de Lacalle

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted Findings ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13392 2025-05-27 cs.LG 57%

Time Series Embedding Methods for Classification Tasks: A Review

Habib Irani, Yasamin Ghahremani, Arshia Kermani, Vangelis Metsis

机构 * Department of Computer Science(计算机科学系) Texas State University(德克萨斯州立大学) San Marcos, TX 78666

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18015 2025-05-26 cs.CV cs.LG 57%

SemSegBench & DetecBench: Benchmarking Reliability and Generalization Beyond Classification

Shashank Agnihotri, David Schader, Jonas Jakubassa, Nico Sharei, Simon Kral, Mehmet Ege Kaçar, Ruben Weber, Margret Keuper

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments First seven listed authors have equal contribution. GitHub: https://github.com/shashankskagnihotri/benchmarking_reliability_generalization. arXiv admin note: text overlap with arXiv:2505.05091

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02506 2025-05-21 cs.CL 57%

ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use

Junjie Ye, Zhengyin Du, Xuesong Yao, Weijian Lin, Yufei Xu, Zehui Chen, Zaiyuan Wang, Sining Zhu, Zhiheng Xi, Siyu Yuan, Tao Gui, Qi Zhang, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学) ByteDance(字节跳动) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13004 2025-05-20 cs.CL 57%

EffiBench-X: A Multi-Language Benchmark for Measuring Efficiency of LLM-Generated Code

Yuhao Qing, Boyu Zhu, Mingzhe Du, Zhijiang Guo, Terry Yue Zhuo, Qianru Zhang, Jie M. Zhang, Heming Cui, Siu-Ming Yiu, Dong Huang, See-Kiong Ng, Luu Anh Tuan

机构 * HKU(香港大学) UCL(伦敦大学学院) NTU(南洋理工大学) NUS(新加坡国立大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) Monash University(莫纳什大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61分部) KCL(伦敦大学国王学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12798 2025-05-20 cs.AI 57%

BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models

Yige Li, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13001 2025-05-20 cs.AI 57%

CRUXEval-X: A Benchmark for Multilingual Code Reasoning, Understanding and Execution

Ruiyang Xu, Jialun Cao, Yaojie Lu, Ming Wen, Hongyu Lin, Xianpei Han, Ben He, Shing-Chi Cheung, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

Comments 18pages, Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09116 2025-05-15 cs.CL 57%

P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs

Yidan Zhang, Yu Wan, Boyi Deng, Baosong Yang, Haoran Wei, Fei Huang, Bowen Yu, Junyang Lin, Fei Huang, Jingren Zhou

机构 * Tongyi Lab, Alibaba Group Inc(通义实验室,阿里巴巴集团)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08485 2025-05-14 cs.AI stat.ML 57%

BAT: Benchmark for Auto-bidding Task

Alexandra Khirianova, Ekaterina Solodneva, Andrey Pudovikov, Sergey Osokin, Egor Samosvat, Yuriy Dorn, Alexander Ledovsky, Yana Zenkova

机构 * Avito(阿维托) Lebedev Physical Institute of the Russian Academy of Sciences(俄罗斯科学院列别杰夫物理研究所) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Lomonosov Moscow State University(莫斯科国立罗曼诺夫大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 11 pages, 10 figures, WWW 2025 conference

Journal ref J.Proceedings of the ACM on Web Conference 1 (2025) 2657

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16267 2025-05-14 cs.SD cs.LG eess.AS q-bio.QM 57%

A Classification Benchmark for Artificial Intelligence Detection of Laryngeal Cancer from Patient Voice

Mary Paterson, James Moor, Luisa Cutillo

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments 16 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07425 2025-05-13 cs.SE 57%

A Systematic Literature Review on Neural Code Translation

Xiang Chen, Jiacheng Xue, Xiaofei Xie, Caokai Liang, Xiaolin Ju

专题命中 代码评测 :code model(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05326 2025-05-09 cs.SE 57%

TS-Detector : Detecting Feature Toggle Usage Patterns

Tajmilur Rahman, Mengzhe Fei, Tushar Sharma, Chanchal Roy

专题命中 代码评测 :repository(abstract);分类 cs.SE

Comments 33rd ACM International Conference on the Foundations of Software Engineering, June 23--28, 2025, Trondheim, Norway

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04844 2025-05-09 cs.CL 57%

Osiris: A Lightweight Open-Source Hallucination Detection System

Alex Shan, John Bauer, Christopher D. Manning

机构 * Stanford University(斯坦福大学) Stanford HAI(斯坦福HAI)

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments Stanford 191W

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01627 2025-05-06 cs.LG cs.CE 57%

A Domain Adaptation of Large Language Models for Classifying Mechanical Assembly Components

Fatemeh Elhambakhsh, Daniele Grandi, Hyunwoong Ko

机构 * School of Computing and Augmented Intelligence, Arizona State University, Tempe, AZ(Arizona State大学计算机与增强智能学院) Autodesk, San Francisco, CA(Autodesk公司) School of Manufacturing Systems and Networks, Arizona State University, Mesa, AZ(Arizona State大学制造系统与网络学院)

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20121 2025-04-30 cs.LG 57%

Benchmarking Transferability: A Framework for Fair and Robust Evaluation

Alireza Kazemi, Helia Rezvani, Mahsa Baktashmotlagh

机构 * The University of Queensland(昆士兰大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19335 2025-04-29 cs.SE 57%

Exploring the Impact of Integrating UI Testing in CI/CD Workflows on GitHub

Xiaoxiao Gan, Chris Brown

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏