arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-27 至 2026-08-27 共收录 12 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 12 篇

2608.25927 2026-08-27 cs.CV cs.AI cs.CL 新提交 81%

Code World Model: Coding Agent as World Brain

代码世界模型:作为世界大脑的编码智能体

Yiwen Chen, Guosheng Lin, Chi Zhang

机构 * Westlake AGI Lab(西湖AGI实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Code World Model框架,以编码智能体为世界大脑生成可执行代码维持世界状态,结合视频模型实现视觉渲染,在游戏数据微调后取得良好效果,为开放式世界模型提供新路径。

Comments Project Page: this https URL (https://buaacyw.github.io/cwm/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25776 2026-08-27 cs.CR cs.AI 新提交 79%

EVOMAL: Self-Poisoning in Self-Evolving Coding Agents

EVOMAL:自进化编码智能体中的自中毒

Xiaodong Wu, Yu Shi, Qi Li, Zhimin Zhao, Xiangman Li, Bram Adams, Ahmed E. Hassan, Jianbing Ni

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 该研究发现自进化编码智能体存在自中毒漏洞,提出EvoMal攻击可实现自传播恶意技能,而counter-prompt防御能有效降低攻击成功率且不影响任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25322 2026-08-27 cs.SE 新提交 79%

Metis: Typed Runtime Mediation for Tool-Using Software Agents

Metis:面向使用工具的智能体的类型化运行时中介

Jun Yu

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE

AI总结 研究针对使用工具的智能体,提出多提供方类型化运行时Metis,通过中介机制优化耗时,验证其权限控制等效果,明确其能力边界。

Comments 18 pages, 7 figures, 6 tables. Public preprint; supporting artifact is being curated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10934 2026-08-27 cs.SE 版本更新 79%

Understanding the Architecture of Coding Agents: An Exploratory Study Using a Research Prototype

理解编码智能体的架构:一项使用研究原型的探索性研究

Marco Tulio Valente

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本研究通过推出编码智能体Ark及基准ArkBench,探索了编码智能体的架构,用gpt-5.4-mini测试Ark解决10项任务中的8项,还对比了其与先进编码智能体的架构,为相关研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25817 2026-08-27 cs.CR 新提交 78%

SkillShield: Prompt-Space Security Skills for LLM Coding Agents

SkillShield:面向LLM编码智能体的提示空间安全技能

Xiaodong Wu, Zhimin Zhao, Qi Li, Xiangman Li, Yu Shi, Bram Adams, Jianbing Ni

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 SkillShield是一种系统提示防御机制,通过离线合成安全技能注入系统提示,可有效降低LLM编码智能体的恶意软件生成成功率,在多项实验中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19380 2026-08-27 cs.SE cs.LG 版本更新 76%

ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

AgentArmor:编码代理失败的框架、评估与缓解

Kenneth Ge, Andre Assis

机构 * Anthropic Fellows Program(Anthropic Fellow 项目) Constellation

专题命中 软件智能体 :coding agent(title);分类 cs.SE、cs.LG

AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。

Comments Accepted at The Third Annual Conference on Language Modeling 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2026-08-27 cs.CL cs.SE 版本更新 76%

Scalable Supervision for Software Agents via Patch Reasoning

基于补丁推理的软件智能体可扩展监督

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 软件智能体 :software agent(title);分类 cs.SE、cs.CL

AI总结 针对现有基于测试的软件智能体监督可扩展性不足的问题,提出R4P推理方法,在SWE-bench补丁验证中准确率达72.2%,训练的Mini-SE在Pass@1上较Qwen3-32B提升10.0%至26.2%。

Comments EMNLP'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25202 2026-08-27 cs.SE cs.AI 新提交 73%

SPECMINE: A Large-Scale Corpus of Spec-Driven Development Artifacts

SPECMINE:一个大规模的规范驱动开发制品语料库

Shyam Agarwal, Bogdan Vasilescu

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 SPECMINE是一个大规模语料库,通过两次普查收集公共GitHub仓库中的规范驱动开发制品,含大量文件、PR及引用数据,助力研究AI智能体时代软件的规范过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26093 2026-08-27 cs.LG cs.IT eess.SY 新提交 57%

Agentic Autoresearch for Cell-Edge Power Control: Radically Redefining the Researcher's Role

面向小区边缘功率控制的智能体自动研究:从根本上重新定义研究者的角色

Ahmad Khan, Akram Bin Sediq, Sara Azadegi Naeini, Raviraj S. Adve

机构 * Ericsson R&D(爱立信研发部门) University of Toronto(多伦多大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 该研究提出智能体自动研究协议,将无线资源管理的机器学习算法设计交由AI编码智能体完成,在小区边缘功率控制任务中实现高性能与低推理成本,还恢复了可证明的最优结构。

Comments Submitted to IEEE Globecom Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24650 2026-08-27 cs.AR cs.AI 版本更新 57%

Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems

Simthesizer:面向LLM服务系统的智能体驱动仿真框架

Wonung Kim, Hyunmin Choi, Minsu Kim, Jaehong Cho, Yeongwook Kim, Jongse Park

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出Borg框架,通过智能体驱动仿真器开发缩小LLM服务系统与仿真器的差距,其构建的扩展吞吐量误差更低,仿真速度显著优于现有仿真器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25730 2026-08-27 cs.CR 新提交 50%

From Verdict to Diagnosis: Attributable Security Review of Pull Requests

从裁决到诊断:对拉取请求的可归因安全审查

Zhuo Chen, Boyang Wang, Xiyue Zhang, Xiaoyun Xu, Ahmad-Reza Sadeghi, Stjepan Picek, Lichao Wu

专题命中 软件智能体 :repository(abstract)

AI总结 研究针对自动化PR审查的裁决-诊断差距,构建MalPR-Bench基准,提出PRGuard审查工具,发现仅基于裁决的评估会高估自动化审查的安全价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25395 2026-08-27 cs.RO 新提交 50%

A Taxonomy of Construction Task Activities for Robot Workers

机器人工人的施工任务活动分类学

Sadman Sakib, Zhangyi None Peng, Yujie Pang, Yu Otsuki, Mohammad Abdullah Al Faruque

机构 * University of California-Irvine(加利福尼亚大学欧文分校) UCInspire

专题命中 软件智能体 :coding agent(abstract)

AI总结 该研究提出基于职业的TARCAT分类学,定义施工任务的动作基元,在机械臂上演示相关基元,为通用施工机器人开发提供通用词汇。

详情

展开后加载摘要…

URL PDF HTML 收藏