arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-25 至 2026-08-25 共收录 20 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2607.09146 2026-08-25 cs.SE 版本更新 79%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

Comments 21 pages, Accepted at the 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026), Regular Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00391 2026-08-25 cs.CV 版本更新 78%

VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning

VinciCoder:通过粗到细的视觉强化学习统一多模态代码生成

Xuanle Zhao, Deyang Jiang, Zhixiong Zeng, Lei Chen, Haoyue Yang, Haibo Qiu, Jing Huang, Yufeng Zhong, Liming Zheng, Yilin Cao, Lin Ma

机构 * Meituan(美团)

专题命中 代码生成 :code generation(title,abstract)

AI总结 VinciCoder通过粗到细的视觉强化学习框架,统一多模态代码生成,实现最先进的性能,超越现有开源模型。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00708 2026-08-25 cs.AI cs.LG 版本更新 62%

MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition

MOSAIC:结构化智能体智能与组合的模块化编排

Yifan Bao, Xinyu Xi, Xinyu Liu, Wen Ge, Lei Jiang, Kevin Zhang, Raad Khraishi, Yihao Ang, Anthony K.H. Tung, Lukasz Szpruch, Hao Ni

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) University College London(伦敦大学学院) University of Edinburgh(爱丁堡大学) Data & Analytics, Digital X(Digital X 数据与分析部) Alan Turing Institute(艾伦·图灵研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出MOSAIC框架,通过结构化智能体编排、记忆驱动的模型选择和蓝图构建,将自动化数据科学转化为可验证、可复用的模型选择问题,在金融时间序列任务中优于AutoML和智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04384 2026-08-25 cs.AI 版本更新 57%

Improving Auto-Design of Neural PDE Solvers with a Domain-Specific Language

用领域特定语言改进神经偏微分方程求解器的自动设计

Shengxin Kong, Liwen Xu, Jingwen Fu

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-08-25 cs.AI physics.flu-dyn 版本更新 57%

Self-Evolving Scientific Agent Discovers Generalizable Physically-Reasoned Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2606.01317 2026-08-25 cs.SE cs.CR 版本更新 79%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-25 cs.CL 版本更新 74%

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(title);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2601.19066 2026-08-25 cs.SE cs.AI 版本更新 81%

Dynamic Cogeneration of Bug Reproduction Test in Agentic Program Repair

代理程序修复中的动态共生测试生成

Runxiang Cheng, Michele Tufano, José Cambronero, Renyao Wei, Sherry Shi, Grant Uy, Pat Rondon, Franjo Ivančić

机构 * Google, USA(谷歌(美国))

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI

AI总结 本文研究了在程序修复中动态共生生成测试的方法,通过在同一补丁中生成修复和测试用例,提高修复的可信度并减少维护成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 3 篇

2605.26851 2026-08-25 cs.SE 版本更新 83%

LLM-based Low-Level Integration Test Generation for Java

基于LLM的Java无模拟单元测试生成

Qinghua Xu, Guancheng Wang, Lionel Briand, Zhaoqiang Guo, Kui Liu

专题命中 测试生成 :unit test generation(title,abstract);code generation(abstract);分类 cs.SE

AI总结 提出MocklessTester方法,通过上下文增强生成和约束强制修复解决LLM生成无模拟单元测试时的幻觉问题,在Defects4J和Deps4J上显著提升覆盖率和变异得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-25 cs.SE 版本更新 57%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09689 2026-08-25 cs.AI math.PR math.ST 版本更新 57%

Evidence-Aware MapReduce for Forkable Compute

玻尔兹曼MapReduce:可分叉沙盒的配分函数归约

Yossi Eliaz

机构 * Incredibuild(Incredibuild公司) HIT CS Department(以色列理工学院计算机科学系)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 研究在局部渐近正态性下工作节点发出的置信密度,指出其为吉布斯 - 玻尔兹曼测度,逆温度是样本大小。高斯/线性下相关结果精确,MapReduce归约是配分函数,还有频率主义一致性等结论。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 5 篇

2606.11864 2026-08-25 cs.IR 版本更新 67%

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

CORE-Bench:智能体编程时代代码检索的综合基准

Fuwei Zhang, Yanzhao Zhang, Mingxin Li, Dingkun Long, Lexiang Hu, Pengjun Xie, Zhao Zhang, Fuzhen Zhuang

专题命中 代码评测 :repository(abstract);coding agent(abstract)

AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。

Comments Accepted By EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04448 2026-08-25 cs.AI cs.CL cs.CV cs.LG cs.MA 版本更新 67%

SkillNet: Create, Evaluate, and Connect AI Skills

SkillNet: 创建、评估和连接AI技能

Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Yida Xue, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tongji University(同济大学) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) Tencent(腾讯) Fudan University(复旦大学) The University of Edinburgh(爱丁堡大学) Monash University(墨尔本大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huzhou University(湖州大学) Hornor Device Co., Ltd(Hornor设备有限公司) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。

Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12295 2026-08-25 cs.CL cs.AI cs.LG 版本更新 67%

Text-ADBench: Text Anomaly Detection Benchmark Based on LLM Embeddings

Text-ADBench:基于大语言模型嵌入的文本异常检测基准

Feng Xiao, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了基于LLM嵌入的文本异常检测基准,通过多模型、多数据集的实验发现嵌入质量决定检测效果,深度学习方法在LLM嵌入下无性能优势,还提出了高效评估策略并开源工具包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18646 2026-08-25 cs.AI cs.CL 版本更新 62%

Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap

超越基准:基于拟人化与生命周期导向路线图的大语言模型评估

Jun Wang, Ninglun Gu, Kailai Zhang, Pengyong Li, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Zijiao Zhang, Yihuan Liu, Gary G. Yen, Junchi Yan

机构 * Department of Networks, China Mobile Communications Group Co.,Ltd.(中国移动通信集团有限公司网络部) Xidian University(西安电子科技大学) Oklahoma State University(俄克拉荷马州立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM基准分数与实际效用脱节问题,建立诊断本体并提出含IQ、PQ、EQ、VQ的拟人化评估框架,分析200余个基准后为LLM开发提供战略指引。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17136 2026-08-25 quant-ph cs.ET 版本更新 50%

Gate-level Implementation and Resource Analysis of Lackadaisical Quantum Walk Search

懒散量子行走搜索的门级实现与资源分析

Amit Saha, Debanjan Kola, Nishanka Das, Amlan Chakrabarti

专题命中 代码评测 :code model(abstract)

AI总结 本文提出懒散量子行走搜索的门级实现框架,验证其搜索性能并分析资源开销,为量子硬件上的懒散量子行走搜索提供实用实现方案及容错资源评估。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 4 篇

2601.09716 2026-08-25 cs.CL 版本更新 57%

Opportunities and Challenges of Natural Language Processing for Low-Resource Senegalese Languages in Social Science Research

自然语言处理在塞内加尔语言社会科学研究中的机遇与挑战

Derguene Mbaye, Tatiana D. P. Mbengue, Madoune R. Seye, Moussa Diallo, Mamadou L. Ndiaye, Dimitri S. Adjanohoun, Cheikh S. Wade, Djiby Sow, Jean-Claude B. Munyaka, Jerome Chenal

机构 * Polytechnic School (ESP)(多科技术校) Gaston Berger University (UGB)(加斯顿-伯杰大学) Federal Institute of Technology Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文探讨了自然语言处理在塞内加尔六种语言社会科学研究中的机遇与挑战,提出构建可持续的NLP生态系统,强调伦理治理与跨学科合作。

Comments 45 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05813 2026-08-25 cs.SE 版本更新 57%

An Empirical Study of Java Code Improvements Based on Stack Overflow Answer Edits

基于Stack Overflow回答编辑的Java代码改进实证研究

In-on Wiratsin, Chaiyong Ragkhitwetsagul, Matheus Paixao, Denis De Sousa, Pongpop Lapvikai, Peter Haddawy

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究通过分析Stack Overflow的Java回答编辑,识别可改进的开源Java代码,发现近7%的采纳回答有多次修订,近半数编辑代码可应用于开源项目,11个bug修复方案被接受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19001 2026-08-25 cs.CY 版本更新 50%

Open at the Edge, Captured at the Center: llama.cpp and the Political Economy of Local AI Inference

边缘开放,中心捕获:llama.cpp 与本地 AI 推理的政治经济学

Woohyeuk Lee, Hanlin Li, David Gray Widder

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究以 llama.cpp 为对象,分析本地 AI 推理的政治经济动态,发现本地推理拓宽参与度却将控制权向基础设施相关方转移,呼吁政策关注推理基础设施以维持云外 AI 开放性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05708 2026-08-25 q-bio.QM 版本更新 50%

HuBMAP Data Portal: a resource for multimodal spatial and single-cell data of healthy human tissues

HuBMAP 数据门户:健康人体组织多模态空间和单细胞数据的资源

Morgan L. Turner (1), Thomas C. Smits (1), Tiffany S. Liaw (1), Brendan Honick (2), Bill Shirey (3), Lisa Choy (1), Nikolay Akhmetov (1), Shaokun An (4), David Betancur (2), Dominic Bordelon (2), Karl Burke (3), Ivan Cao-Berg (2), John Conroy (1), Chris Csonka (2), Penny Cuda (5), Sean Donahue (5), Stephen Fisher (6), Derek Furst (3), Ed Hanna (2), Josef Hardi (7), Tabassum Kakar (1), Mark S. Keller (1), Devin Lange (1), Xiang Li (2), Yan Ma (1), Alison McWilliams (2), Austen Money (1), Richard Morgan (3), Eric Moerth (1), Juan Muerto (2), Mark A. Musen (7), Emily Nic (2), Martin J. O'Connor (7), Gesina Phillips (2), Alexander J. Ropelewski (2), Ryan Sablosky (2), Sravani Saripalli (4), Max Sibilla (3), Derek Simmel (2), Alan Simmons (3), Xu Tang (4), Joel Welling (2), Zhou Yuan (3), Martin Hemberg (4), HuBMAP Consortium (8), Matthew Ruffalo (5), Jonathan Silverstein (3), Philip Blood (2), Nils Gehlenborg (1) ((1) Harvard Medical School, Boston, MA 02115, (2) Pittsburgh Supercomputing Center, Carnegie Mellon University, Pittsburgh, PA 15213, (3) University of Pittsburgh, Pittsburgh PA 15260, (4) Gene Lay Institute of immunology and Inflammation, Brigham and Women's Hospital, Harvard Medical School and Massachusetts General Hospital, Boston, MA 02115, (5) Carnegie Mellon University, Pittsburgh, PA 15213, (6) University of Pennsylvania, Philadelphia, PA 19104, (7) Stanford University, Stanford, CA 94305, (8) A list of consortium authors and their affiliations appear at the end of the paper)

专题命中 仓库级理解 :repository(abstract)

AI总结 介绍 HuBMAP 数据门户,一个整合健康人体组织多模态空间和单细胞数据的综合平台,支持搜索、可视化和分析,并通过统一处理流程确保数据可比性。

Comments 41 pages; 8 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏