arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-26 至 2026-08-26 共收录 31 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 9 篇

2608.23630 2026-08-26 cs.SE 新提交 79%

FPGAgent: An LLM-Assisted Framework for Autonomous HLS Code Generation and Verification in FPGA Environments

FPGAgent:一种用于FPGA环境中自主HLS代码生成与验证的大语言模型辅助框架

Tianyu Wang, Wenjie Wang, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 FPGAgent是首个经成熟基准验证的任务规范到可执行HLS生成的多智能体框架,可自主生成并验证FPGA的HLS代码,在HLS-Eval基准上可综合率等指标平均提升16.9%等,大幅提升了LLM生成HLS代码的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24138 2026-08-26 cs.CV 新提交 78%

Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation

作为自演进UI转代码生成视觉修复上下文的评分标准

Tianyi Xiong, Zhengyuan Yang, Xiaofei Wang, Chung-Ching Lin, Ruichun Ma, Kevin Lin, Zhendong Wang, Linjie Li, Chenxi Liu, Ruibo Chen, Ramani Duraiswami, Heng Huang, Lijuan Wang

机构 * University of Maryland(马里兰大学) Microsoft(微软公司)

专题命中 代码生成 :code generation(title,abstract)

AI总结 该研究针对视觉语言模型UI转代码自演进不稳定的问题,提出RubSE框架,利用评分标准作为视觉修复上下文,在多模型多基准上显著提升了生成性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24492 2026-08-26 cs.LG cs.AI cs.CL 新提交 67%

When Do Supervised UQ Ensembles Improve LLM Hallucination Detection? A Robustness Study

当监督式不确定性量化集成能提升大语言模型幻觉检测性能?一项鲁棒性研究

Mohit Singh Chauhan, Vipin Gyanchandani, Dylan Bouchard

机构 * CVS Health(CVS健康公司)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究监督式UQ集成对LLM幻觉检测的鲁棒性,在多模型、多数据集、多生成范式下分析其性能,发现其多数场景优于单个评分器,采样黑盒集成效果接近全集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23622 2026-08-26 cs.AI cs.CL cs.MA cs.SE 新提交 67%

LLM Agents Perform Controlled Experiments Using Simulation Models

大语言模型智能体使用模拟模型开展对照实验

Yuchen Xia, Michael Weyrich, Nasser Jazdi, Johannes Stümpfle, Johannes Sigel, Akshay Narla, Gavin K. Reynolds, Anna Jawor-Baczynska, Pol Llopart

机构 * Institute for Industrial Automation and Software Engineering(工业自动化与软件工程研究所) University of Stuttgart(斯图加特大学) AstraZeneca(阿斯利康)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本研究提出多智能体框架,将LLM与高保真模拟模型结合,使LLM智能体可开展制药工艺设计的对照实验,生成更具体可操作的优化建议,在工业场景中表现更优。

Comments Accepted at the 31st IEEE International Conference on Emerging Technologies and Factory Automation ETFA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23848 2026-08-26 cs.AI cs.LG 新提交 62%

Exploit More, Explore Smarter for Budget-Constrained Agentic Search

面向预算受限的智能体搜索:更充分利用,更智能探索

Haoyang Fang, Bernie Wang

机构 * Amazon AGI(亚马逊AGI)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对预算受限的智能体搜索场景,提出ExTS树搜索策略,结合三种机制优化树搜索,在多项任务上实现性能提升,还提供了问题结构差异的诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23842 2026-08-26 cs.SE cs.AI cs.DC 新提交 62%

Automated Synthesis of Cloud Emulators

云模拟器的自动化合成

Archit Bhatnagar, Zhenning Yang, Sarah McClure, Yiming Qiu, Sylvia Ratnasamy, Ang Chen

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 针对DevOps程序测试中云模拟器构建难的问题,提出基于神经符号代码合成的CloudEmu方法,其在AWS、GCP服务上的覆盖率与准确性优于手动开发的LocalStack。

Comments 12 pages, 8 figures, 5 tables, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24720 2026-08-26 cs.SE 新提交 57%

''You Can't Open an LLM With a Screwdriver'': The De-Democratization of Software

“你不能用螺丝刀打开大语言模型”:软件的去民主化

Zixuan Feng, Italo Santos, Kostadin Damevski, Anita Sarma

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文指出AI虽扩大代码生成获取范围但或使软件控制权集中,软件工程专业知识重心转向意图规范,并提出教育、工具和政策领域的研究机遇以应对AI时代挑战。

Comments Accepted to the ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24641 2026-08-26 cs.SE 新提交 57%

Aging of Prompt Engineering Techniques Across LLM Versions

提示工程技术在大语言模型版本间的老化现象

Anastasiia Rudyk, Julian Oertel, Regina Hebig

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究通过评估三类模型对的五种提示技术,发现提示工程效果随LLM代际以模型家族特定方式老化,需针对性调整而非照搬。

Comments Accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23867 2026-08-26 cs.MA cs.CL 新提交 57%

Markets, Not Planners: Decentralized Orchestration of LLM Agents with Private Information

市场而非规划者:利用私有信息对大语言模型智能体进行去中心化协调

Xiao Liu, Haoyang Li, Songwei Li, Hongbo Fang, Fengli Xu, Feng Shi, James Evans

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 针对中心化LLM智能体协调的瓶颈与易操控问题,提出去中心化的AgentLance重复劳动力市场机制,经多类任务验证,其匹配专长、转向廉价智能体的表现优于基线方法,还可通过修正市场失灵进一步提升效率。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2608.24188 2026-08-26 cs.AI cs.CL cs.LG cs.SE 新提交 83%

Paritok-4B: Intent-Conditioned Context Compression for Coding Agents

Paritok-4B:面向编码智能体的意图条件上下文压缩模型

Jiayu Shi, Luzhuo Chen

机构 * Paritok

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 针对编码智能体上下文占比过高的问题,提出意图条件抽取式压缩模型 Paritok-4B,在 SWE-bench Lite 上实现高压缩率的同时,未显著降低求解率,且成本更低、可自托管。

Comments 20 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24221 2026-08-26 cs.SE cs.CL cs.PL 新提交 82%

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration

DeepRepoQA:基于深度智能体探索的代码仓库问答系统

Weihan Peng, Yuling Shi, Yingwei Ma, Longfei Yun, Beijun Shen, Xiaodong Gu

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL、cs.PL

AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24358 2026-08-26 cs.AI 新提交 70%

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents

交接代价:在大语言模型智能体中延续非原生轨迹

Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman

机构 * AWS, Agentic AI(亚马逊云科技智能体人工智能部门)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究聚焦大语言模型智能体的交接代价,通过对比Claude和GPT系列模型的不同交接设置,发现完整轨迹升级质量提升有限且成本高,降级更具优势,且交接接口偏好随方向反转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24644 2026-08-26 cs.SE cs.AI cs.PL 新提交 67%

A Literate Programming Environment for Human and Machine Agents

面向人类与机器智能体的 Literate Programming(文学式编程)环境

Adam T. Burke

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 本文提出一种文学式编程环境,通过语法、解析器、名称图及绑定机制,让代码与相关上下文并置,提升 LLM 窗口利用率,为 LLM 编码智能体提供类 IDE 工具集,并实现了绑定三种编程语言的可运行版本及示例程序。

Comments 13 pages, 5 figures (code and grammar listings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23740 2026-08-26 cs.AI cs.SE 新提交 62%

AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

AgentRoom:基于CRDT支持的共享工作空间的并发多智能体编码

Seonglae Cho, Donghyun Lee

机构 * Holistic AI(整体人工智能公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 AgentRoom是基于CRDT的并发多智能体编码协议,通过协调机制减少任务放弃率,在计算量匹配下优于单独运行和并行合并,为多智能体编码提供更优方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24747 2026-08-26 cs.CL 新提交 57%

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

SkillForge:为强化学习智能体演化可验证技能

Shidong Yang, Ziyu Ma, Tongwen Huang, Xucong Wang, Renda Li, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 SkillForge是实现技能验证与优化的持续技能演化框架,通过明确技能使用优化RL决策,在ALFWorld等数据集上优于SkillRL,可训练更强的LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24650 2026-08-26 cs.AR cs.AI 新提交 57%

Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems

Simthesizer:面向LLM服务系统的智能体驱动仿真框架

Wonung Kim, Hyunmin Choi, Minsu Kim, Jaehong Cho, Yeongwook Kim, Jongse Park

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出Borg框架,通过智能体驱动仿真器开发缩小LLM服务系统与仿真器的差距,其构建的扩展吞吐量误差更低,仿真速度显著优于现有仿真器。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2608.24020 2026-08-26 cs.CV cs.AI 新提交 86%

IterCAD: Iterative Program Repair for CAD Code Generation from Orthographic Views

IterCAD:基于正交视图的CAD代码生成的迭代程序修复方法

Yuchuan Wu, Ke Niu, Haiyang Yu, Zhuofan Chen, Xiangyang Xue, Bin Li

机构 * Fudan University(复旦大学) ByteDance Inc.(字节跳动公司)

专题命中 程序修复 :program repair(title,abstract);code generation(title);分类 cs.AI

AI总结 IterCAD是一种迭代框架,将正交视图转CAD代码任务重构为渐进式程序修复,通过三阶段训练与监督集优化,在CADExpert上显著提升了代码可执行性与几何保真度。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23651 2026-08-26 cs.SE cs.AI 新提交 62%

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail

适得其反的反馈:为什么小型语言模型智能体重复它们刚刚看到的失败调用

Esmail Gumaan

专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.AI

AI总结 该研究发现小型语言模型智能体的失败工具调用反馈会适得其反,调用表面形式是主要原因,替换失败描述或使其不可达可减少重复,明确指令或删除失败尝试无效。

Comments 25 pages, 6 figures, 13 tables. Code, data, probe items and rollout logs: this https URL (https://github.com/Esmail-ibraheem/feedback-that-backfires)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2608.24135 2026-08-26 cs.AI cs.SE 新提交 62%

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习

Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 5 篇

2608.23653 2026-08-26 cs.SE cs.AI 新提交 73%

Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling

超越可执行模型:用于物理系统建模的Pufibara智能体框架与Modelica智能体工作流基准

Zizhe Wang

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对物理系统建模中智能体的状态管理与证据关联问题,提出Pufibara智能体框架,并构建含232个任务的基准,实验显示其在任务成功率与资源效率上优于Claude Code。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24086 2026-08-26 cs.AI cs.CE cs.SE 新提交 62%

EMRB: A Multi-Level Benchmark for Evaluating LLM Reasoning over Raw Electromagnetic Signals

EMRB:用于评估大型语言模型对原始电磁信号推理能力的多级基准

Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang, Shan Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The 63rd Research Institute, National University of Defense Technology(国防科技大学第六十三研究所) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出EMRB基准评估LLMs对原始电磁信号的推理能力,针对14个LLMs的实验显示其表现存在差距,提出的ReconPilot方法可显著提升LLMs的相关任务得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23918 2026-08-26 cs.AI cs.MA cs.PL 新提交 62%

MARS: Multi-Specialist LLM Relay System for Competitive Programming

MARS:用于竞赛编程的多专家大语言模型中继系统

Andrei Mikhailov, Mikhail Burtsev, Alsu Sagirova

机构 * MIRAI London Institute for Mathematical Sciences(伦敦数学科学研究院) AXXX

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 MARS是用于竞赛编程的多专家LLM中继框架,通过检索选择算法领域专家组成流水线,在CodeContests测试集上以更低成本和方差达到0.624±0.006的通过率,缩小了与CodeSIM的差距。

Comments 13 pages, 8 figures, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23632 2026-08-26 cs.AI cs.SE 新提交 62%

Function-Level Execution Feedback for Code Preference Optimization

用于代码偏好优化的函数级执行反馈

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。

Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24439 2026-08-26 cs.CV 新提交 50%

DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton

DoublesEval:通过专业双打羽毛球诊断视觉语言模型的多智能体战术推理能力

Jintao Cheng, Weibin Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学)

专题命中 代码评测 :repository(abstract)

AI总结 本研究提出DoublesEval框架,以专业双打羽毛球为测试平台评估VLMs的多智能体战术推理能力,发现现有模型存在明显瓶颈,所提TacticCheck可提升模型表现但仍有差距,强调需改进VLMs的评估范式。

Comments Accepted by BMVC2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 6 篇

2608.23619 2026-08-26 cs.SE cs.AI 新提交 81%

Identifying Latent Declarative Representations of Code for Assisting Repository Migration

识别代码的隐式声明式表示以辅助代码仓库迁移

Shraddha Surana, Ashwin Srinivasan, Michael Bain

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 该研究针对遗留代码仓库迁移难题,提出 ADFD-Migrate 方法,通过显式化代码的隐式声明式表示提升移植效果,在新基准 f2x50 上取得优于对比方法的移植正确性与完整性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24807 2026-08-26 cs.SE cs.AI 新提交 62%

Automatic Model Card Generation Using an LLM

基于大语言模型的自动模型卡片生成

Tajkia Rahman Toma, Balreet Grewal, Cor-Paul Bezemer

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出基于LLM的MCTidy与MCGenie,前者重组模型卡片为标准化模板,后者从仓库数据直接生成,经48个Hugging Face模型验证,可实现标准化、可扩展的模型卡片文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23611 2026-08-26 cs.SE cs.AI 新提交 62%

REFINE: A Multi-Agent LLM Approach for Evidence-Guided Code Refactoring

REFINE:一种用于证据引导代码重构的多智能体大语言模型方法

Muhammad Waseem, Aakash Ahmad, Pekka Abrahamsson

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出多智能体方法REFINE,结合静态分析、LLM等技术生成Java代码重构候选,在450个文件上使异味降低超68%,效果优于直接提示基线,但存在残留风险需人工审查。

Comments Preprint. 450 Java files from 15 open-source systems; 1,350 model-pass outputs across three LLM configurations. The accompanying replication package will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23754 2026-08-26 cs.SE 新提交 57%

Enhancing Bug Report Templates in the TianoCore UEFI Firmware Development Community

增强TianoCore UEFI固件开发社区中的漏洞报告模板

Laura Baird, Neelesh Reddybattula, Nazanin Siavash, Terrance E. Boult, Armin Moin

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究针对TianoCore核心项目EDK II,通过分析漏洞数据发现关键信息缺失问题,拟在GitHub Issues的漏洞报告模板中新增字段,计划经开发者反馈调整及A/B测试验证,以优化UEFI固件漏洞分类与解决流程。

Comments ACM International Workshop on Firmware Testing and Analysis (FTA) 2026, Co-located with ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23602 2026-08-26 cs.AR 新提交 50%

PACT: Post-route Agentic Checkpoint Tuning for FPGA Timing Closure

PACT:面向FPGA时序收敛的后路由代理检查点调优

Huan Lin, Kunlong Li, Lingli Wang, Zhiang Zhang

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出PACT框架,用于Vivado设计检查点的后路由调优,在35个UltraScale+检查点上将F_max几何平均提升22.30%,速度较DATuner快6.4倍,令牌成本仅0.16美元/ DCP。

Comments Accepted to the 2026 International Conference on Field-Programmable Technology (FPT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23659 2026-08-26 math.AP 新提交 50%

Relative formalization in Isabelle/HOL of a result in inverse problems

Isabelle/HOL中关于反问题结果的相对形式化

Cătălin I. Cârstea

专题命中 仓库级理解 :repository(abstract)

AI总结 本研究利用Isabelle/HOL对arXiv:2606.15977中的反问题结果开展自动形式化实验,基于熟知的外部结果完成证明,相关文件已在GitHub仓库公开。

详情

展开后加载摘要…

URL PDF HTML 收藏