arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1740 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1740 篇

2511.18249 2025-11-25 cs.SE 57%

LLM Assisted Coding with Metamorphic Specification Mutation Agent

基于元形态规范变异代理的LLM编码

Mostafijur Rahman Akhond, Gias Uddin

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CodeMetaAgent通过元形态关系驱动LLM代理,提升代码生成准确性与覆盖率,有效解决规范不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16709 2025-11-24 cs.CR cs.AI 57%

AutoBackdoor: Automating Backdoor Attacks via LLM Agents

AutoBackdoor: 通过LLM代理自动化后门攻击

Yige Li, Zhe Li, Wei Zhao, Nay Myat Min, Hanxun Huang, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 AutoBackdoor通过LLM代理自动化后门攻击,实现高效触发器生成和毒化数据构建,验证了对抗防御的脆弱性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16224 2025-11-24 cs.SE 57%

Beyond Code Similarity: Benchmarking the Plausibility, Efficiency, and Complexity of LLM-Generated Smart Contracts

超越代码相似性:评估LLM生成智能合约的可信度、效率和复杂性

Francesco Salzano, Simone Scalabrino, Rocco Oliveto, Remo Pareschi

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文评估了LLM生成智能合约的可信度、效率和复杂性,发现检索增强生成显著提升了功能正确性,但生成代码仍需专家验证。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12194 2025-11-24 cs.AI 57%

ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents

ResearStudio: 一种可人工干预的构建可控深度研究代理的框架

Linyi Yang, Yixuan Weng

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 ResearStudio是一种可人工干预的深度研究代理框架,通过实时人类控制与自动化相结合,在GAIA基准中取得最佳性能。

Comments EMNLP 2025 Demo, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06387 2025-11-21 hep-th cs.LG 57%

Learning the Inverse Ryu--Takayanagi Formula with Transformers

利用Transformer学习逆Ryu-Takayanagi公式

Sejin Kim

机构 * KIAS(韩国基础科学研究院)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文利用Transformer模型学习逆Ryu-Takayanagi公式,通过数据驱动的方法重构黑洞函数并外推至无horizon背景。

Comments 15 pages, 6 figures, miner changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14876 2025-11-20 cs.CR cs.CV cs.LG cs.RO 57%

Attacking Autonomous Driving Agents with Adversarial Machine Learning: A Holistic Evaluation with the CARLA Leaderboard

Henry Wong, Clement Fung, Weiran Lin, Karen Li, Stanley Chen, Lujo Bauer

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01668 2025-11-18 cs.AI 57%

Hybrid Retrieval-Augmented Generation Agent for Trustworthy Legal Question Answering in Judicial Forensics

Yueqing Xi, Yifan Bai, Huasen Luo, Weiliang Wen, Hui Liu, Haoliang Li

机构 * Department of Electronic Engineering, City University of Hong Kong(DongGuan)(香港城市大学(东莞)电子工程系) Department of Electronic Engineering, City University of Hong Kong(香港城市大学电子工程系)

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09708 2025-11-14 cs.LG 57%

Efficient Hyperdimensional Computing with Modular Composite Representations

Marco Angioli, Christopher J. Kymn, Antonello Rosato, Amy Loutfi, Mauro Olivieri, Denis Kleyko

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) University of California at Berkeley(加州大学伯克利分校) Örebro University(欧雷布罗大学) Linköping University(林哈姆斯大学) RISE Research Institutes of Sweden(瑞典RISE研究所)

专题命中 代码评测 :code model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07698 2025-11-12 cs.SE 57%

Smart but Costly? Benchmarking LLMs on Functional Accuracy and Energy Efficiency

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Antonio Mastropaolo, Tushar Sharma

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23071 2025-11-07 cs.CL 57%

Text2VectorSQL: Towards a Unified Interface for Vector Search and SQL Queries

Zhengren Wang, Dongwen Yao, Bozhou Li, Dongsheng Ma, Bo Li, Zhiyu Li, Feiyu Xiong, Bin Cui, Linpeng Tang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) OriginHub Technology(OriginHub科技) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18140 2025-11-06 cs.CL 57%

MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning

Xiaoyuan Li, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01527 2025-11-04 cs.AI 57%

TPS-Bench: Evaluating AI Agents' Tool Planning \& Scheduling Abilities in Compounding Tasks

Hanwen Xu, Xuyao Huang, Yuzhe Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00872 2025-11-04 cs.SE 57%

A Comprehensive Empirical Evaluation of Agent Frameworks on Code-centric Software Engineering Tasks

Zhuowen Yin, Cuifeng Gao, Chunsong Fan, Wenzhang Yang, Yinxing Xue, Lijun Zhang

专题命中 代码评测 :program repair(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10446 2025-11-03 cs.CL 57%

Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models

Zemin Huang, Zhiyang Chen, Zijun Wang, Tiancheng Li, Guo-Jun Qi

机构 * Zhejiang Univeristy(浙江大学) MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Matterwave Intelligence Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所以高级技术研究所)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025. Code link: https://github.com/maple-research-lab/LLaDOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14681 2025-10-31 cs.CL 57%

Massive Supervised Fine-tuning Experiments Reveal How Data, Layer, and Training Factors Shape LLM Alignment Quality

Yuto Harada, Yusuke Yamauchi, Yusuke Oda, Yohei Oseki, Yusuke Miyao, Yu Takagi

机构 * NII LLMC(日本信息处理学会大语言模型中心) The University of Tokyo(东京大学) NAIST(日本科学技术大学) Nagoya Institute of Technology(名古屋技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference). Models and evaluation results available at: https://github.com/llm-jp/massive-sft

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26287 2025-10-31 cs.SE 57%

Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search

Guochang Li, Yuchen Liu, Zhen Qin, Yunkun Wang, Jianping Zhong, Chen Zhi, Binhua Li, Fei Huang, Yongbin Li, Shuiguang Deng

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24452 2025-10-29 cs.DC cs.LG 57%

ARIMA_PLUS: Large-scale, Accurate, Automatic and Interpretable In-Database Time Series Forecasting and Anomaly Detection in Google BigQuery

Xi Cheng, Weijie Shen, Haoming Chen, Chaoyi Shen, Jean Ortega, Jiashang Liu, Steve Thomas, Honglin Zheng, Haoyun Wu, Yuxiang Li, Casey Lichtendahl, Jenny Ortiz, Gang Liu, Haiyang Qi, Omid Fatemieh, Chris Fry, Jing Jing Long

机构 * Google(谷歌)

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14856 2025-10-24 cs.SE 57%

CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects

Hanyang Guo, Xunjin Zheng, Zihan Liao, Hang Yu, Peng DI, Ziyin Zhang, Hong-Ning Dai

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18468 2025-10-22 cs.CL 57%

IMB: An Italian Medical Benchmark for Question Answering

Antonio Romano, Giuseppe Riccio, Mariano Barone, Marco Postiglione, Vincenzo Moscato

机构 * University of Naples Federico II, Department of Electrical Engineering(那不勒斯费德里科二世大学电子工程系) Consorzio Interuniversitario Nazionale per l'Informatica (CINI) - ITEM National Lab(国家信息计算联合研究中心(CINI)- ITEM国家实验室) Northwestern University, Department of Computer Science, McCormick School of Engineering(西北大学计算机科学系,工程学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

Journal ref CLIC-it 2025: Eleventh Italian Conference on Computational Linguistics, Cagliari, Italy, September 24-26, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17376 2025-10-21 cs.SE 57%

AdapTrack: Constrained Decoding without Distorting LLM's Output Intent

Yongmin Li, Jia Li, Ge Li, Zhi Jin

专题命中 代码评测 :code generation(abstract);分类 cs.SE

Comments to be published in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14700 2025-10-17 cs.SE cs.CR 57%

LLM Agents for Automated Web Vulnerability Reproduction: Are We There Yet?

Bin Liu, Yanjie Zhao, Guoai Xu, Haoyu Wang

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20534 2025-10-17 cs.PL cs.MS cs.SC 57%

Efficient Symbolic Computation via Hash Consing

Bowen Zhu, Aayush Sabharwal, Songchen Tan, Yingbo Ma, Alan Edelman, Christopher Rackauckas

专题命中 代码评测 :code generation(abstract);分类 cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14471 2025-10-17 cs.CL 57%

Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs

Koshiro Saito, Sakae Mizuki, Masanari Ohi, Taishi Nakamura, Taihei Shiotani, Koki Maeda, Youmi Ma, Kakeru Hattori, Kazuki Fujii, Takumi Okamoto, Shigeki Ishida, Hiroya Takamura, Rio Yokota, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted as a spotlight at the 1st workshop on Multilingual and Equitable Language Technologies (MELT), COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04364 2025-10-16 cs.MA cs.CL 57%

Benchmarking LLMs' Swarm intelligence

Kai Ruan, Mowen Huang, Ji-Rong Wen, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(人工智能学院,中国人民大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24394 2025-10-14 cs.CY cs.AI 57%

The 2025 OpenAI Preparedness Framework does not guarantee any AI risk mitigation practices: a proof-of-concept for affordance analyses of AI safety policies

Sam Coggins, Alexander K. Saeri, Katherine A. Daniell, Lorenn P. Ruster, Jessie Liu, Jenny L. Davis

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 19 pages, 5 tables, 1 figure; minor ambiguities clarified, typos corrected, author affiliations added

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13735 2025-10-14 cs.CL 57%

EEG-MedRAG: Enhancing EEG-based Clinical Decision-Making via Hierarchical Hypergraph Retrieval-Augmented Generation

Yi Wang, Haoran Luo, Lu Meng, Ziyu Jia, Xinliang Zhou, Qingsong Wen

机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学) Foshan Graduate School of Innovation, Northeastern University(创新佛山研究生院,东北大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Squirrel Ai Learning

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03046 2025-10-13 cs.LG 57%

Graph Transformer with Disease Subgraph Positional Encoding for Improved Comorbidity Prediction

Xihan Qin, Li Liao

专题命中 代码评测 :repository(abstract);分类 cs.LG

Journal ref Quantitative Biology 13, no. 4 (2025): e70008

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05899 2025-10-13 cs.SE 57%

Prompt engineering and its implications on the energy consumption of Large Language Models

Riccardo Rubei, Aicha Moussaid, Claudio di Sipio, Davide di Ruscio

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16185 2025-10-09 cs.CL 57%

ParamBench: A Graduate-Level Benchmark for Evaluating LLM Understanding on Indic Subjects

Ayush Maheshwari, Kaushal Sharma, Vivek Patel, Aditya Maheshwari

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05468 2025-10-09 cs.CL 57%

LatteReview: A Multi-Agent Framework for Systematic Review Automation Using Large Language Models

Pouria Rouzrokh, Bardia Khosravi, Parsa Rouzrokh, Moein Shariatnia

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments 31 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏