arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-26 至 2026-08-26 共收录 42 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 14 篇

2608.23630 2026-08-26 cs.SE 新提交 79%

FPGAgent: An LLM-Assisted Framework for Autonomous HLS Code Generation and Verification in FPGA Environments

FPGAgent:一种用于FPGA环境中自主HLS代码生成与验证的大语言模型辅助框架

Tianyu Wang, Wenjie Wang, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 FPGAgent是首个经成熟基准验证的任务规范到可执行HLS生成的多智能体框架,可自主生成并验证FPGA的HLS代码,在HLS-Eval基准上可综合率等指标平均提升16.9%等,大幅提升了LLM生成HLS代码的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24138 2026-08-26 cs.CV 新提交 78%

Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation

作为自演进UI转代码生成视觉修复上下文的评分标准

Tianyi Xiong, Zhengyuan Yang, Xiaofei Wang, Chung-Ching Lin, Ruichun Ma, Kevin Lin, Zhendong Wang, Linjie Li, Chenxi Liu, Ruibo Chen, Ramani Duraiswami, Heng Huang, Lijuan Wang

机构 * University of Maryland(马里兰大学) Microsoft(微软公司)

专题命中 代码生成 :code generation(title,abstract)

AI总结 该研究针对视觉语言模型UI转代码自演进不稳定的问题,提出RubSE框架,利用评分标准作为视觉修复上下文,在多模型多基准上显著提升了生成性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24492 2026-08-26 cs.LG cs.AI cs.CL 新提交 67%

When Do Supervised UQ Ensembles Improve LLM Hallucination Detection? A Robustness Study

当监督式不确定性量化集成能提升大语言模型幻觉检测性能?一项鲁棒性研究

Mohit Singh Chauhan, Vipin Gyanchandani, Dylan Bouchard

机构 * CVS Health(CVS健康公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究监督式UQ集成对LLM幻觉检测的鲁棒性,在多模型、多数据集、多生成范式下分析其性能,发现其多数场景优于单个评分器,采样黑盒集成效果接近全集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23622 2026-08-26 cs.AI cs.CL cs.MA cs.SE 新提交 67%

LLM Agents Perform Controlled Experiments Using Simulation Models

大语言模型智能体使用模拟模型开展对照实验

Yuchen Xia, Michael Weyrich, Nasser Jazdi, Johannes Stümpfle, Johannes Sigel, Akshay Narla, Gavin K. Reynolds, Anna Jawor-Baczynska, Pol Llopart

机构 * Institute for Industrial Automation and Software Engineering(工业自动化与软件工程研究所) University of Stuttgart(斯图加特大学) AstraZeneca(阿斯利康)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本研究提出多智能体框架,将LLM与高保真模拟模型结合,使LLM智能体可开展制药工艺设计的对照实验,生成更具体可操作的优化建议,在工业场景中表现更优。

Comments Accepted at the 31st IEEE International Conference on Emerging Technologies and Factory Automation ETFA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08010 2026-08-26 cs.CL cs.LG cs.SE 版本更新 67%

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

低延迟系统中的工具制作与自我进化大语言模型智能体

Kalle Kujanpää, Ning Liu, Shahnawaz Alam, Yeshwanth Reddy Sura, Tianyu Yang, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 研究如何解决生产LLM智能体因重复生成代码浪费延迟和可靠性的问题,提出用智能工具制作管道取代推理时编码循环,部署该方法使系统更快、更可靠、易操作,降低延迟和错误率,提高可审计性。

Comments To appear at EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23848 2026-08-26 cs.AI cs.LG 新提交 62%

Exploit More, Explore Smarter for Budget-Constrained Agentic Search

面向预算受限的智能体搜索:更充分利用,更智能探索

Haoyang Fang, Bernie Wang

机构 * Amazon AGI(亚马逊AGI)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对预算受限的智能体搜索场景,提出ExTS树搜索策略,结合三种机制优化树搜索,在多项任务上实现性能提升,还提供了问题结构差异的诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23842 2026-08-26 cs.SE cs.AI cs.DC 新提交 62%

Automated Synthesis of Cloud Emulators

云模拟器的自动化合成

Archit Bhatnagar, Zhenning Yang, Sarah McClure, Yiming Qiu, Sylvia Ratnasamy, Ang Chen

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 针对DevOps程序测试中云模拟器构建难的问题,提出基于神经符号代码合成的CloudEmu方法,其在AWS、GCP服务上的覆盖率与准确性优于手动开发的LocalStack。

Comments 12 pages, 8 figures, 5 tables, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24720 2026-08-26 cs.SE 新提交 57%

''You Can't Open an LLM With a Screwdriver'': The De-Democratization of Software

“你不能用螺丝刀打开大语言模型”:软件的去民主化

Zixuan Feng, Italo Santos, Kostadin Damevski, Anita Sarma

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文指出AI虽扩大代码生成获取范围但或使软件控制权集中,软件工程专业知识重心转向意图规范,并提出教育、工具和政策领域的研究机遇以应对AI时代挑战。

Comments Accepted to the ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24641 2026-08-26 cs.SE 新提交 57%

Aging of Prompt Engineering Techniques Across LLM Versions

提示工程技术在大语言模型版本间的老化现象

Anastasiia Rudyk, Julian Oertel, Regina Hebig

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究通过评估三类模型对的五种提示技术,发现提示工程效果随LLM代际以模型家族特定方式老化,需针对性调整而非照搬。

Comments Accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23867 2026-08-26 cs.MA cs.CL 新提交 57%

Markets, Not Planners: Decentralized Orchestration of LLM Agents with Private Information

市场而非规划者:利用私有信息对大语言模型智能体进行去中心化协调

Xiao Liu, Haoyang Li, Songwei Li, Hongbo Fang, Fengli Xu, Feng Shi, James Evans

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 针对中心化LLM智能体协调的瓶颈与易操控问题,提出去中心化的AgentLance重复劳动力市场机制,经多类任务验证,其匹配专长、转向廉价智能体的表现优于基线方法,还可通过修正市场失灵进一步提升效率。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23200 2026-08-26 cs.CL 版本更新 57%

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因

Xiao Zhang, Qumeng Sun, Jiahao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang

机构 * EvoMap Tsinghua University(清华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-08-26 cs.AI physics.flu-dyn 版本更新 57%

Self-Evolving Scientific Agent Designs Physically-Reasoned Whitebox Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11578 2026-08-26 cs.AI 版本更新 57%

Efficient LLM Collaboration via Planning

通过规划实现高效的LLM协作

Byeongchan Lee, Jonghoon Lee, Dongyoung Kim, Jaehyung Kim, Kyungjoon Park, Dongjun Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出COPE框架,通过规划模型与执行模型的协作,提升小模型和大模型在复杂任务中的性能,同时显著降低推理成本。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00704 2026-08-26 cs.LG 版本更新 57%

QiMeng-ChipV-RTL: Exploiting Information Locality for IP-level Verilog Generation

LocalV: 利用信息局部性进行IP级Verilog生成

Hanqi Lyu, Di Huang, Yaoyu Zhu, Kangcheng Liu, Bohan Dou, Chongxiao Li, Pengwei Jin, Shuyao Cheng, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen

机构 * University of Science(科学大学) SKL of Processors, Institute of Computing Technology, CAS(处理器研究所,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 LocalV通过利用模块化硬件设计中的信息局部性,解决IP级Verilog生成中的长文档处理、长代码生成和调试挑战,实现更高的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2608.24188 2026-08-26 cs.AI cs.CL cs.LG cs.SE 新提交 83%

Paritok-4B: Intent-Conditioned Context Compression for Coding Agents

Paritok-4B:面向编码智能体的意图条件上下文压缩模型

Jiayu Shi, Luzhuo Chen

机构 * Paritok

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 针对编码智能体上下文占比过高的问题,提出意图条件抽取式压缩模型 Paritok-4B,在 SWE-bench Lite 上实现高压缩率的同时,未显著降低求解率,且成本更低、可自托管。

Comments 20 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24221 2026-08-26 cs.SE cs.CL cs.PL 新提交 82%

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration

DeepRepoQA:基于深度智能体探索的代码仓库问答系统

Weihan Peng, Yuling Shi, Yingwei Ma, Longfei Yun, Beijun Shen, Xiaodong Gu

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL、cs.PL

AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24358 2026-08-26 cs.AI 新提交 70%

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents

交接代价:在大语言模型智能体中延续非原生轨迹

Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman

机构 * AWS, Agentic AI(亚马逊云科技智能体人工智能部门)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究聚焦大语言模型智能体的交接代价,通过对比Claude和GPT系列模型的不同交接设置,发现完整轨迹升级质量提升有限且成本高,降级更具优势,且交接接口偏好随方向反转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24644 2026-08-26 cs.SE cs.AI cs.PL 新提交 67%

A Literate Programming Environment for Human and Machine Agents

面向人类与机器智能体的 Literate Programming(文学式编程)环境

Adam T. Burke

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 本文提出一种文学式编程环境,通过语法、解析器、名称图及绑定机制,让代码与相关上下文并置,提升 LLM 窗口利用率,为 LLM 编码智能体提供类 IDE 工具集,并实现了绑定三种编程语言的可运行版本及示例程序。

Comments 13 pages, 5 figures (code and grammar listings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23740 2026-08-26 cs.AI cs.SE 新提交 62%

AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

AgentRoom:基于CRDT支持的共享工作空间的并发多智能体编码

Seonglae Cho, Donghyun Lee

机构 * Holistic AI(整体人工智能公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 AgentRoom是基于CRDT的并发多智能体编码协议,通过协调机制减少任务放弃率,在计算量匹配下优于单独运行和并行合并,为多智能体编码提供更优方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24747 2026-08-26 cs.CL 新提交 57%

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

SkillForge:为强化学习智能体演化可验证技能

Shidong Yang, Ziyu Ma, Tongwen Huang, Xucong Wang, Renda Li, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 SkillForge是实现技能验证与优化的持续技能演化框架,通过明确技能使用优化RL决策,在ALFWorld等数据集上优于SkillRL,可训练更强的LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24650 2026-08-26 cs.AR cs.AI 新提交 57%

Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems

Simthesizer:面向LLM服务系统的智能体驱动仿真框架

Wonung Kim, Hyunmin Choi, Minsu Kim, Jaehong Cho, Yeongwook Kim, Jongse Park

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出Borg框架,通过智能体驱动仿真器开发缩小LLM服务系统与仿真器的差距,其构建的扩展吞吐量误差更低,仿真速度显著优于现有仿真器。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2608.24020 2026-08-26 cs.CV cs.AI 新提交 86%

IterCAD: Iterative Program Repair for CAD Code Generation from Orthographic Views

IterCAD:基于正交视图的CAD代码生成的迭代程序修复方法

Yuchuan Wu, Ke Niu, Haiyang Yu, Zhuofan Chen, Xiangyang Xue, Bin Li

机构 * Fudan University(复旦大学) ByteDance Inc.(字节跳动公司)

专题命中 程序修复 :program repair(title,abstract);code generation(title);分类 cs.AI

AI总结 IterCAD是一种迭代框架,将正交视图转CAD代码任务重构为渐进式程序修复,通过三阶段训练与监督集优化,在CADExpert上显著提升了代码可执行性与几何保真度。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23651 2026-08-26 cs.SE cs.AI 新提交 62%

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail

适得其反的反馈:为什么小型语言模型智能体重复它们刚刚看到的失败调用

Esmail Gumaan

专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.AI

AI总结 该研究发现小型语言模型智能体的失败工具调用反馈会适得其反,调用表面形式是主要原因,替换失败描述或使其不可达可减少重复,明确指令或删除失败尝试无效。

Comments 25 pages, 6 figures, 13 tables. Code, data, probe items and rollout logs: this https URL (https://github.com/Esmail-ibraheem/feedback-that-backfires)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2608.24135 2026-08-26 cs.AI cs.SE 新提交 62%

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习

Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 8 篇

2608.23653 2026-08-26 cs.SE cs.AI 新提交 73%

Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling

超越可执行模型:用于物理系统建模的Pufibara智能体框架与Modelica智能体工作流基准

Zizhe Wang

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对物理系统建模中智能体的状态管理与证据关联问题,提出Pufibara智能体框架,并构建含232个任务的基准,实验显示其在任务成功率与资源效率上优于Claude Code。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24086 2026-08-26 cs.AI cs.CE cs.SE 新提交 62%

EMRB: A Multi-Level Benchmark for Evaluating LLM Reasoning over Raw Electromagnetic Signals

EMRB:用于评估大型语言模型对原始电磁信号推理能力的多级基准

Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang, Shan Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The 63rd Research Institute, National University of Defense Technology(国防科技大学第六十三研究所) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出EMRB基准评估LLMs对原始电磁信号的推理能力,针对14个LLMs的实验显示其表现存在差距,提出的ReconPilot方法可显著提升LLMs的相关任务得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23918 2026-08-26 cs.AI cs.MA cs.PL 新提交 62%

MARS: Multi-Specialist LLM Relay System for Competitive Programming

MARS:用于竞赛编程的多专家大语言模型中继系统

Andrei Mikhailov, Mikhail Burtsev, Alsu Sagirova

机构 * MIRAI London Institute for Mathematical Sciences(伦敦数学科学研究院) AXXX

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 MARS是用于竞赛编程的多专家LLM中继框架,通过检索选择算法领域专家组成流水线,在CodeContests测试集上以更低成本和方差达到0.624±0.006的通过率,缩小了与CodeSIM的差距。

Comments 13 pages, 8 figures, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23632 2026-08-26 cs.AI cs.SE 新提交 62%

Function-Level Execution Feedback for Code Preference Optimization

用于代码偏好优化的函数级执行反馈

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。

Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29717 2026-08-26 cond-mat.mtrl-sci cs.AI cs.LG 版本更新 62%

Optimizing Expert-Designed Crystal Graph Networks for Band-Gap Prediction with an Autonomous LLM Research Loop

利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测

Chenmu Zhang, Boris I. Yakobson

机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16497 2026-08-26 cs.LG cs.AI 版本更新 62%

msData: A Millisecond-Resolution Network Dataset for Advancing Time Series Foundation Models

弥合高频数据缺口:一种毫秒级分辨率的网络数据集以推进时间序列基础模型

Subina Khanal, Seshu Tirupathi, Merim Dzaferagic, Marco Ruffini, Torben Bach Pedersen

机构 * Department of Computer Science, Aalborg University, Aalborg, Denmark(奥尔堡大学计算机科学系) IBM Research Europe, Dublin, Ireland(IBM欧洲研究院) Trinity College Dublin, The University of Dublin, Dublin, Ireland(都柏林大学三一学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个毫秒级分辨率的数据集,用于提升时间序列基础模型对高频数据的处理能力,并展示传统模型在该数据集上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏