arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-10 至 2025-12-10 共收录 11 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2512.08810 2025-12-10 cs.SE cs.AI cs.LG 82%

Multicalibration for LLM-based Code Generation

面向LLM的多校准代码生成

Viola Campos, Robin Kuschnereit, Adrian Ulges

机构 * RheinMain University of Applied Sciences(莱茵-美因应用科学大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出多校准方法以提升代码生成模型的置信度评分准确性,通过实验验证其在技能分数上的显著提升。

Comments Accepted at AI-SQE 2026 (The 1st International Workshop on AI for Software Quality Evaluation: Judgment, Metrics, Benchmarks, and Beyond)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20215 2025-12-10 cs.AR cs.AI cs.SE 76%

The Cream Rises to the Top: Efficient Reranking Method for Verilog Code Generation

顶层的奶油:一种高效的Verilog代码生成重排序方法

Guang Yang, Wei Zheng, Xiang Chen, Yifan Sun, Fengji Zhang, Terry Yue Zhuo

机构 * Northwest Polytechnical University, Shaanxi, China(西北工业大学) Nantong University, Jiangsu, China(南通大学) Minzu University of China, Beijing, China(中央民族大学) City University of Hong Kong, Hong Kong, China(香港城市大学) Monash University, Victoria, Australia(墨尔本大学)

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI

AI总结 本文提出VCD-RNK模型,通过语义对齐问题解决Verilog生成中的领域知识不足问题,提升代码生成的可靠性与效率。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17923 2025-12-10 cs.LG cs.AI 62%

Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning

奖励旅程,而非仅终点:一种复合路径和答案自评分奖励机制用于测试时强化学习

Jingyu Xing, Chenwei Tang, Xinyu Liu, Deng Xiong, Shudong Huang, Wei Ju, Jiancheng Lv, Ziyue Qiao

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Great Bay University(大湾大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 COMPASS通过自评分机制提升测试时强化学习的推理能力,增强模型分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03295 2025-12-10 cs.AI cs.RO cs.SE 62%

Capability-Driven Skill Generation with LLMs: A RAG-Based Approach for Reusing Existing Libraries and Interfaces

基于能力驱动的技能生成:一种基于RAG的方法,用于重用现有库和接口

Luis Miguel Vieira da Silva, Aljosha Köcher, Nicolas König, Felix Gehlhoff, Alexander Fay

机构 * Ruhr University, Bochum, Germany(鲁尔大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一种基于RAG的方法,利用大语言模型生成可执行代码,通过整合现有库和接口实现能力驱动的技能生成。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08266 2025-12-10 cs.SE 57%

Token Sugar: Making Source Code Sweeter for LLMs through Token-Efficient Shorthand

Token Sugar:通过高效的token缩写使源代码更甜

Zhensu Sun, Chengran Yang, Xiaoning Du, Zhou Yang, Li Li, David Lo

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 Token Sugar通过高效的token缩写减少源代码的token数量,提升LLM在代码生成中的效率和性能。

Comments Accepted by ASE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08213 2025-12-10 cs.SE 57%

Secure or Suspect? Investigating Package Hallucinations of Shell Command in Original and Quantized LLMs

安全还是可疑?探究原始和量化LLM生成的shell命令中的包幻觉

Md Nazmul Haque, Elizabeth Lin, Lawrence Arkoh, Biruk Tadesse, Bowen Xu

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究探讨量化对LLM生成Go包中包幻觉和安全风险的影响,发现量化降低精度会增加幻觉率和漏洞风险,揭示LLM生成依赖项的系统性错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码评测 2 篇

2512.07921 2025-12-10 cs.SE cs.AI 73%

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08867 2025-12-10 cs.SE 57%

SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA

SimpleDevQA:在开发知识问答上评估大语言模型

Jing Zhang, Lianghong Guo, Yanlin Wang, Mingwei Liu, Jiachi Chen, Yuchi Ma, Ensheng Shi, Terry Yue Zhuo, Hongyu Zhang, Zibin Zheng

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 SimpleDevQA是一个基于真实用户对话构建的多语言基准,用于评估大语言模型在开发知识问答任务中的表现,通过三阶段流程生成2740个问答对,发现代码LLM在该任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 仓库级理解 2 篇

2512.08326 2025-12-10 cs.CR cs.AI 57%

Argus: A Multi-Agent Sensitive Information Leakage Detection Framework Based on Hierarchical Reference Relationships

Argus:基于分层参考关系的多智能体敏感信息泄露检测框架

Bin Wang, Hui Li, Liyang Zhang, Qijia Zhuang, Ao Yang, Dong Zhang, Xijun Luo, Bing Lin

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(超高清沉浸媒体技术广东省重点实验室,北京大学深圳研究生院) University of Electronic Science and Technology of China(电子科技大学) Tencent Security Platform Department(腾讯安全平台部) China Unicom (Guangdong) Industrial Internet Co., Ltd(中国联通(广东)工业互联网有限公司)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 Argus通过多智能体协作框架整合关键内容、文件上下文和项目参考关系,有效降低误报率,提升敏感信息检测的准确性和效率。

Comments 11 pages, 7 figures, 8 tables;Accepted to ICSE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07539 2025-12-10 cs.LG 57%

FRWKV:Frequency-Domain Linear Attention for Long-Term Time Series Forecasting

FRWKV:频率域线性注意力用于长期时间序列预测

Qingyuan Yang, Shizhuo Deng, Dongyue Chen, Da Teng, Zehua Gan

机构 * College of Information Science and Engineering(信息科学与工程学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 FRWKV通过频率域线性注意力机制提升长序列时间序列预测的效率与准确性

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 程序分析与验证 1 篇

2512.07814 2025-12-10 cs.SE cs.AI cs.CR 76%

Understanding Privacy Risks in Code Models Through Training Dynamics: A Causal Approach

通过训练动态理解代码模型中的隐私风险:一种因果方法

Hua Yang, Alejandro Velasco, Sen Fang, Bowen Xu, Denys Poshyvanyk

机构 * North Carolina State University(北卡罗来纳州立大学) William & Mary(威廉与玛丽学院)

专题命中 程序分析与验证 :code model(title);分类 cs.SE、cs.AI

AI总结 本研究通过因果方法分析代码模型中不同PII类型的泄露风险差异,揭示了泄露风险与可学习性之间的因果关系,并为开发类型感知的防御策略提供依据。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏