arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12227 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1750 篇

2511.18966 2025-11-25 cs.AI cs.CR 57%

LLM-CSEC: Empirical Evaluation of Security in C/C++ Code Generated by Large Language Models

LLM-CSEC: 对大型语言模型生成的C/C++代码安全性的实证评估

Muhammad Usman Shahid, Chuadhry Mujeeb Ahmed, Rajiv Ranjan

机构 * Independent Researcher(独立研究者) Newcastle University(新castle大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型生成的C/C++代码安全性,发现存在大量漏洞,强调开发人员需谨慎使用此类代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17125 2025-11-25 cs.SE 57%

Large Language Model Unlearning for Source Code

大型语言模型的源代码去学习

Xue Jiang, Yihong Dong, Huangzhao Zhang, Tangxinyu Wang, Zheng Fang, Yingwei Ma, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Yongbin Li, Ge Li

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究提出PROD方法,通过精确去学习源代码中的违规片段,提升代码生成的可靠性与安全性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 57%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18249 2025-11-25 cs.SE 57%

LLM Assisted Coding with Metamorphic Specification Mutation Agent

基于元形态规范变异代理的LLM编码

Mostafijur Rahman Akhond, Gias Uddin

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CodeMetaAgent通过元形态关系驱动LLM代理,提升代码生成准确性与覆盖率,有效解决规范不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16709 2025-11-24 cs.CR cs.AI 57%

AutoBackdoor: Automating Backdoor Attacks via LLM Agents

AutoBackdoor: 通过LLM代理自动化后门攻击

Yige Li, Zhe Li, Wei Zhao, Nay Myat Min, Hanxun Huang, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 AutoBackdoor通过LLM代理自动化后门攻击,实现高效触发器生成和毒化数据构建,验证了对抗防御的脆弱性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16224 2025-11-24 cs.SE 57%

Beyond Code Similarity: Benchmarking the Plausibility, Efficiency, and Complexity of LLM-Generated Smart Contracts

超越代码相似性:评估LLM生成智能合约的可信度、效率和复杂性

Francesco Salzano, Simone Scalabrino, Rocco Oliveto, Remo Pareschi

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文评估了LLM生成智能合约的可信度、效率和复杂性,发现检索增强生成显著提升了功能正确性,但生成代码仍需专家验证。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12194 2025-11-24 cs.AI 57%

ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents

ResearStudio: 一种可人工干预的构建可控深度研究代理的框架

Linyi Yang, Yixuan Weng

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 ResearStudio是一种可人工干预的深度研究代理框架,通过实时人类控制与自动化相结合,在GAIA基准中取得最佳性能。

Comments EMNLP 2025 Demo, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06387 2025-11-21 hep-th cs.LG 57%

Learning the Inverse Ryu--Takayanagi Formula with Transformers

利用Transformer学习逆Ryu-Takayanagi公式

Sejin Kim

机构 * KIAS(韩国基础科学研究院)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文利用Transformer模型学习逆Ryu-Takayanagi公式,通过数据驱动的方法重构黑洞函数并外推至无horizon背景。

Comments 15 pages, 6 figures, miner changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14876 2025-11-20 cs.CR cs.CV cs.LG cs.RO 57%

Attacking Autonomous Driving Agents with Adversarial Machine Learning: A Holistic Evaluation with the CARLA Leaderboard

Henry Wong, Clement Fung, Weiran Lin, Karen Li, Stanley Chen, Lujo Bauer

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01668 2025-11-18 cs.AI 57%

Hybrid Retrieval-Augmented Generation Agent for Trustworthy Legal Question Answering in Judicial Forensics

Yueqing Xi, Yifan Bai, Huasen Luo, Weiliang Wen, Hui Liu, Haoliang Li

机构 * Department of Electronic Engineering, City University of Hong Kong(DongGuan)(香港城市大学(东莞)电子工程系) Department of Electronic Engineering, City University of Hong Kong(香港城市大学电子工程系)

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09708 2025-11-14 cs.LG 57%

Efficient Hyperdimensional Computing with Modular Composite Representations

Marco Angioli, Christopher J. Kymn, Antonello Rosato, Amy Loutfi, Mauro Olivieri, Denis Kleyko

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) University of California at Berkeley(加州大学伯克利分校) Örebro University(欧雷布罗大学) Linköping University(林哈姆斯大学) RISE Research Institutes of Sweden(瑞典RISE研究所)

专题命中 代码评测 :code model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07698 2025-11-12 cs.SE 57%

Smart but Costly? Benchmarking LLMs on Functional Accuracy and Energy Efficiency

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Antonio Mastropaolo, Tushar Sharma

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23071 2025-11-07 cs.CL 57%

Text2VectorSQL: Towards a Unified Interface for Vector Search and SQL Queries

Zhengren Wang, Dongwen Yao, Bozhou Li, Dongsheng Ma, Bo Li, Zhiyu Li, Feiyu Xiong, Bin Cui, Linpeng Tang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) OriginHub Technology(OriginHub科技) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18140 2025-11-06 cs.CL 57%

MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning

Xiaoyuan Li, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01527 2025-11-04 cs.AI 57%

TPS-Bench: Evaluating AI Agents' Tool Planning \& Scheduling Abilities in Compounding Tasks

Hanwen Xu, Xuyao Huang, Yuzhe Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00872 2025-11-04 cs.SE 57%

A Comprehensive Empirical Evaluation of Agent Frameworks on Code-centric Software Engineering Tasks

Zhuowen Yin, Cuifeng Gao, Chunsong Fan, Wenzhang Yang, Yinxing Xue, Lijun Zhang

专题命中 代码评测 :program repair(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10446 2025-11-03 cs.CL 57%

Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models

Zemin Huang, Zhiyang Chen, Zijun Wang, Tiancheng Li, Guo-Jun Qi

机构 * Zhejiang Univeristy(浙江大学) MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Matterwave Intelligence Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所以高级技术研究所)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025. Code link: https://github.com/maple-research-lab/LLaDOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14681 2025-10-31 cs.CL 57%

Massive Supervised Fine-tuning Experiments Reveal How Data, Layer, and Training Factors Shape LLM Alignment Quality

Yuto Harada, Yusuke Yamauchi, Yusuke Oda, Yohei Oseki, Yusuke Miyao, Yu Takagi

机构 * NII LLMC(日本信息处理学会大语言模型中心) The University of Tokyo(东京大学) NAIST(日本科学技术大学) Nagoya Institute of Technology(名古屋技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference). Models and evaluation results available at: https://github.com/llm-jp/massive-sft

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26287 2025-10-31 cs.SE 57%

Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search

Guochang Li, Yuchen Liu, Zhen Qin, Yunkun Wang, Jianping Zhong, Chen Zhi, Binhua Li, Fei Huang, Yongbin Li, Shuiguang Deng

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24452 2025-10-29 cs.DC cs.LG 57%

ARIMA_PLUS: Large-scale, Accurate, Automatic and Interpretable In-Database Time Series Forecasting and Anomaly Detection in Google BigQuery

Xi Cheng, Weijie Shen, Haoming Chen, Chaoyi Shen, Jean Ortega, Jiashang Liu, Steve Thomas, Honglin Zheng, Haoyun Wu, Yuxiang Li, Casey Lichtendahl, Jenny Ortiz, Gang Liu, Haiyang Qi, Omid Fatemieh, Chris Fry, Jing Jing Long

机构 * Google(谷歌)

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14856 2025-10-24 cs.SE 57%

CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects

Hanyang Guo, Xunjin Zheng, Zihan Liao, Hang Yu, Peng DI, Ziyin Zhang, Hong-Ning Dai

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18468 2025-10-22 cs.CL 57%

IMB: An Italian Medical Benchmark for Question Answering

Antonio Romano, Giuseppe Riccio, Mariano Barone, Marco Postiglione, Vincenzo Moscato

机构 * University of Naples Federico II, Department of Electrical Engineering(那不勒斯费德里科二世大学电子工程系) Consorzio Interuniversitario Nazionale per l'Informatica (CINI) - ITEM National Lab(国家信息计算联合研究中心(CINI)- ITEM国家实验室) Northwestern University, Department of Computer Science, McCormick School of Engineering(西北大学计算机科学系,工程学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

Journal ref CLIC-it 2025: Eleventh Italian Conference on Computational Linguistics, Cagliari, Italy, September 24-26, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17376 2025-10-21 cs.SE 57%

AdapTrack: Constrained Decoding without Distorting LLM's Output Intent

Yongmin Li, Jia Li, Ge Li, Zhi Jin

专题命中 代码评测 :code generation(abstract);分类 cs.SE

Comments to be published in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14700 2025-10-17 cs.SE cs.CR 57%

LLM Agents for Automated Web Vulnerability Reproduction: Are We There Yet?

Bin Liu, Yanjie Zhao, Guoai Xu, Haoyu Wang

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20534 2025-10-17 cs.PL cs.MS cs.SC 57%

Efficient Symbolic Computation via Hash Consing

Bowen Zhu, Aayush Sabharwal, Songchen Tan, Yingbo Ma, Alan Edelman, Christopher Rackauckas

专题命中 代码评测 :code generation(abstract);分类 cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14471 2025-10-17 cs.CL 57%

Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs

Koshiro Saito, Sakae Mizuki, Masanari Ohi, Taishi Nakamura, Taihei Shiotani, Koki Maeda, Youmi Ma, Kakeru Hattori, Kazuki Fujii, Takumi Okamoto, Shigeki Ishida, Hiroya Takamura, Rio Yokota, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted as a spotlight at the 1st workshop on Multilingual and Equitable Language Technologies (MELT), COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04364 2025-10-16 cs.MA cs.CL 57%

Benchmarking LLMs' Swarm intelligence

Kai Ruan, Mowen Huang, Ji-Rong Wen, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(人工智能学院,中国人民大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24394 2025-10-14 cs.CY cs.AI 57%

The 2025 OpenAI Preparedness Framework does not guarantee any AI risk mitigation practices: a proof-of-concept for affordance analyses of AI safety policies

Sam Coggins, Alexander K. Saeri, Katherine A. Daniell, Lorenn P. Ruster, Jessie Liu, Jenny L. Davis

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 19 pages, 5 tables, 1 figure; minor ambiguities clarified, typos corrected, author affiliations added

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13735 2025-10-14 cs.CL 57%

EEG-MedRAG: Enhancing EEG-based Clinical Decision-Making via Hierarchical Hypergraph Retrieval-Augmented Generation

Yi Wang, Haoran Luo, Lu Meng, Ziyu Jia, Xinliang Zhou, Qingsong Wen

机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学) Foshan Graduate School of Innovation, Northeastern University(创新佛山研究生院,东北大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Squirrel Ai Learning

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03046 2025-10-13 cs.LG 57%

Graph Transformer with Disease Subgraph Positional Encoding for Improved Comorbidity Prediction

Xihan Qin, Li Liao

专题命中 代码评测 :repository(abstract);分类 cs.LG

Journal ref Quantitative Biology 13, no. 4 (2025): e70008

详情

展开后加载摘要…

URL PDF HTML 收藏