arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-27 至 2026-08-27 共收录 17 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2608.25657 2026-08-27 cs.AI cs.LG cs.PL cs.SE 新提交 79%

Narcissus: Program Synthesis Using Context-Aware LLM Approximations

Narcissus:使用上下文感知大语言模型近似值的程序合成

Tilman Hinnerichs, Sebastijan Dumancic, Neil Yorke-Smith

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 代码生成 :program synthesis(title);分类 cs.SE、cs.AI、cs.LG

AI总结 Narcissus是一种程序合成器,通过保留LLM提议的语法树并结合上下文评分与正则化项,在多领域搜索中优于静态引导及修复提议的方法,解决ARC任务的比例显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25457 2026-08-27 cs.CR cs.AI cs.MA 新提交 79%

MACGen: Toward Functionally Correct and Secure Code Generation via Multi-Agent Collaboration

MACGen:通过多智能体协作实现功能正确且安全的代码生成

Miseon Yu, Jaehoon Choi, Younghan Lee, Yunheung Paek

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 MACGen是整合规划等多环节的多智能体代码生成框架,在CWEval、BaxBench基准上,较直接提示显著提升安全代码生成的功能与安全性指标。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26049 2026-08-27 cs.CR cs.AR 新提交 78%

RTLGuard: A Lightweight Teacher-Student Defense for Poisoned RTL Code Generation Models

RTLGuard:一种针对中毒RTL代码生成模型的轻量级师生防御方法

Mahshid Rezakhani, Kimia Azar, Hadi Kamali

专题命中 代码生成 :code generation(title,abstract)

AI总结 RTLGuard是一种轻量级师生防御方法,通过小规模干净教师模型、复合师生目标及特征对齐等,降低中毒RTL代码生成模型的攻击成功率,同时保留代码功能正确性与可综合性。

Comments 8 pages, 4 figures, 7 tables. Accepted at the IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25354 2026-08-27 cs.LG cs.AI cs.CL 新提交 67%

Escaping Low-Dimensional Overlap: Multi-Task Model Merging via High-Dimensional Sparse Disentanglement

逃离低维重叠:通过高维稀疏解缠的多任务模型合并

Yihang Zhang, Shengke Sun, Junjie Wen, Feng Zeng

机构 * Central South University(中南大学) Nanjing University of Science and Technology(南京理工大学) Hefei University of Technology(合肥工业大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多任务模型合并的任务干扰问题,本文提出基于SAEs的高维稀疏解缠合并框架,结合GR-ZOO实现选择性合并,在Qwen2.5系列模型的多任务上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24900 2026-08-27 cs.HC 新提交 50%

Stronger Alignment between Brain Activity and LLM Embeddings during Code Writing compared to Prose Writing

与散文写作相比,代码写作期间大脑活动与大语言模型(LLM)嵌入之间的对齐性更强

Zachary Karas, Catie Chang, Kevin Leach, Yu Huang

专题命中 代码生成 :code generation(abstract)

AI总结 该研究通过fMRI和VEMs发现,代码写作时大脑活动与LLM嵌入的对齐性显著强于散文写作,为相关AI系统设计提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2608.25927 2026-08-27 cs.CV cs.AI cs.CL 新提交 81%

Code World Model: Coding Agent as World Brain

代码世界模型:作为世界大脑的编码智能体

Yiwen Chen, Guosheng Lin, Chi Zhang

机构 * Westlake AGI Lab(西湖AGI实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Code World Model框架,以编码智能体为世界大脑生成可执行代码维持世界状态,结合视频模型实现视觉渲染,在游戏数据微调后取得良好效果,为开放式世界模型提供新路径。

Comments Project Page: this https URL (https://buaacyw.github.io/cwm/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25776 2026-08-27 cs.CR cs.AI 新提交 79%

EVOMAL: Self-Poisoning in Self-Evolving Coding Agents

EVOMAL:自进化编码智能体中的自中毒

Xiaodong Wu, Yu Shi, Qi Li, Zhimin Zhao, Xiangman Li, Bram Adams, Ahmed E. Hassan, Jianbing Ni

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究发现自进化编码智能体存在自中毒漏洞,提出EvoMal攻击可实现自传播恶意技能,而counter-prompt防御能有效降低攻击成功率且不影响任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25322 2026-08-27 cs.SE 新提交 79%

Metis: Typed Runtime Mediation for Tool-Using Software Agents

Metis:面向使用工具的智能体的类型化运行时中介

Jun Yu

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE

AI总结 研究针对使用工具的智能体,提出多提供方类型化运行时Metis,通过中介机制优化耗时,验证其权限控制等效果,明确其能力边界。

Comments 18 pages, 7 figures, 6 tables. Public preprint; supporting artifact is being curated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25817 2026-08-27 cs.CR 新提交 78%

SkillShield: Prompt-Space Security Skills for LLM Coding Agents

SkillShield:面向LLM编码智能体的提示空间安全技能

Xiaodong Wu, Zhimin Zhao, Qi Li, Xiangman Li, Yu Shi, Bram Adams, Jianbing Ni

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 SkillShield是一种系统提示防御机制,通过离线合成安全技能注入系统提示,可有效降低LLM编码智能体的恶意软件生成成功率,在多项实验中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25202 2026-08-27 cs.SE cs.AI 新提交 73%

SPECMINE: A Large-Scale Corpus of Spec-Driven Development Artifacts

SPECMINE:一个大规模的规范驱动开发制品语料库

Shyam Agarwal, Bogdan Vasilescu

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 SPECMINE是一个大规模语料库,通过两次普查收集公共GitHub仓库中的规范驱动开发制品,含大量文件、PR及引用数据,助力研究AI智能体时代软件的规范过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26093 2026-08-27 cs.LG cs.IT eess.SY 新提交 57%

Agentic Autoresearch for Cell-Edge Power Control: Radically Redefining the Researcher's Role

面向小区边缘功率控制的智能体自动研究:从根本上重新定义研究者的角色

Ahmad Khan, Akram Bin Sediq, Sara Azadegi Naeini, Raviraj S. Adve

机构 * Ericsson R&D(爱立信研发部门) University of Toronto(多伦多大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 该研究提出智能体自动研究协议,将无线资源管理的机器学习算法设计交由AI编码智能体完成,在小区边缘功率控制任务中实现高性能与低推理成本,还恢复了可证明的最优结构。

Comments Submitted to IEEE Globecom Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25730 2026-08-27 cs.CR 新提交 50%

From Verdict to Diagnosis: Attributable Security Review of Pull Requests

从裁决到诊断:对拉取请求的可归因安全审查

Zhuo Chen, Boyang Wang, Xiyue Zhang, Xiaoyun Xu, Ahmad-Reza Sadeghi, Stjepan Picek, Lichao Wu

专题命中 软件智能体 :repository(abstract)

AI总结 研究针对自动化PR审查的裁决-诊断差距,构建MalPR-Bench基准,提出PRGuard审查工具,发现仅基于裁决的评估会高估自动化审查的安全价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25395 2026-08-27 cs.RO 新提交 50%

A Taxonomy of Construction Task Activities for Robot Workers

机器人工人的施工任务活动分类学

Sadman Sakib, Zhangyi None Peng, Yujie Pang, Yu Otsuki, Mohammad Abdullah Al Faruque

机构 * University of California-Irvine(加利福尼亚大学欧文分校) UCInspire

专题命中 软件智能体 :coding agent(abstract)

AI总结 该研究提出基于职业的TARCAT分类学,定义施工任务的动作基元,在机械臂上演示相关基元,为通用施工机器人开发提供通用词汇。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2608.25939 2026-08-27 cs.SE 新提交 88%

XREPOTEST: Benchmarking Multilingual Repository-Level Unit Test Generation for Large Language Models

XREPOTEST:面向大语言模型的多语言仓库级单元测试生成基准测试

Dung Le Quang, Dong Cao Van, Nam Le Hai, Linh Ngo Van, Anh M. T. Bui, Phuong T. Nguyen

专题命中 测试生成 :repository(title,abstract);unit test generation(title,abstract);分类 cs.SE

AI总结 本文提出XREPOTEST多语言仓库级单元测试生成基准,针对5种少用语言,结合多上下文策略,用14种LLM实验发现独立与仓库级性能差距,为推进现实场景单元测试生成提供支撑。

Comments Accepted to EMNLP Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 1 篇

2608.25992 2026-08-27 cs.AI cs.MA 新提交 57%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Somgyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 2 篇

2608.25241 2026-08-27 cs.SE cs.AI 新提交 79%

A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption

几页Markdown:采用编码智能体后的已提交AI配置与更低质量成本

Yegor Denisov-Blanch, Shyam Agarwal, Pavel Azaletskiy, Hao He, Rylan Schaeffer, Brando Miranda, Bogdan Vasilescu, Sanmi Koyejo

专题命中 仓库级理解 :repository(abstract,abstract_cn);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出RAMP四级AI成熟度模型,在441个代码库中验证其有效性,发现编码智能体可加速开发,且提交AI配置能降低认知复杂度与静态分析警告增幅。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25174 2026-08-27 cs.SE 新提交 70%

Model-Based Agentic Software Engineering

基于模型的智能体软件工程

James C. Davis, Kelechi Kalu, Huiyun Peng, Parth V. Patil

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 针对编码智能体无法明确项目关键信息的问题,提出MAGE框架及理论,通过外化表征与分配权威构建可信自主系统,经案例与工业案例验证,可将商用智能转化为持久工程进展。

详情

展开后加载摘要…

URL PDF HTML 收藏