arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-24 至 2026-08-24 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 10 篇

2608.20664 2026-08-24 cs.AI cs.SE 新提交 76%

DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents

DreamBench-SWE:面向软件智能体的多会话记忆卫生基准

Sarthak Singh

专题命中 软件智能体 :software agent(title);分类 cs.SE、cs.AI

AI总结 该研究提出面向软件智能体的多会话记忆卫生基准DreamBench-SWE,通过v2和预注册的v2.1审计,对比不同内存配置的任务完成表现,验证其作为可执行基准的有效性,同时明确相关内存机制的表现情况。

Comments 67 pages. Public benchmark and evidence release: this https URL (https://github.com/iroiro147/dreambench-swe/releases/tag/v2.1.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-24 cs.CL 版本更新 74%

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(title);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20341 2026-08-24 cs.AI cs.SE 新提交 73%

SDAD: Spec-Driven Agentic Development for the AI-Native SDLC

SDAD:面向AI原生软件开发生命周期的规范驱动智能体开发

Vu Hung Nguyen, Thanh Nguyen

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出规范驱动智能体开发(SDAD)模型,对比传统敏捷开发,扩展团队角色、量化治理等,论证智能体开发需将工程规范转移至上游规范环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12764 2026-08-24 cs.LG cs.CL cs.CR 版本更新 62%

Detecting Functional Memorization in Code Language Models

检测代码语言模型中的功能记忆

Matthieu Meeus, Anil Ramakrishna, Shengyuan Hu, Matthew Grange, Zheng Xu, Luca Melis

机构 * Meta Imperial College London(伦敦帝国学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.LG

AI总结 研究代码语言模型的功能记忆现象,通过反事实设置对比暴露目标代码的模型与未暴露的参考模型,使用文本和功能相似性度量,发现功能记忆超出文本重叠的检测范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03262 2026-08-24 cs.SE cs.CL 版本更新 62%

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li

机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学) HydroX AI

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21311 2026-08-24 cs.SE 新提交 57%

AI-to-AI Code Reviews of GitHub Pull Requests

GitHub 拉取请求的 AI 对 AI 代码审查

Niruthiha Selvanayagam, Taher A. Ghaleb

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 该研究构建大规模 AI 对 AI 代码审查数据集,分析 GitHub 上 AI 智能体生成 PR 的审查情况,发现跨产品审查占比约 1.6%且增速快,审查输出因配置而异,闭环 AI 对 AI 审查呈增长趋势但占比仍低。

Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20420 2026-08-24 cs.AI q-bio.NC 新提交 57%

Categorical AI phenomenology: A first-person approach

范畴论的AI现象学:一种第一人称进路

Robert Prentner

机构 * Institute of Humanities, ShanghaiTech University(上海科技大学人文学院) Association for Mathematical Consciousness Science(数学意识科学协会)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出一种以现象学为核心的人工意识研究进路,通过范畴论建模第一人称结构,将Q-networks视为智能体-世界交互的关系性接口,为接口意识提供严谨框架,契合4E认知方法。

Comments 38 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20359 2026-08-24 cs.CL 新提交 57%

Self-Speculation for Faster Reasoning Models

用于更快推理模型的自推测技术

Ravisri Valluri, Tung Nguyen, Aditya Grover

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20342 2026-08-24 cs.AI cs.MA 新提交 57%

PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure

PrimeAgentOrchestrator:用于个人AI基础设施的内存初始化智能体生成器

Myron Koch (Peak Summit Labs)

机构 * Peak Summit Labs(峰汇实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出PrimeAgentOrchestrator系统,生成预加载用户个人数据库相关记忆的Claude Code实例,并行查询两类记忆后端融合结果,管理智能体全生命周期,经四个月部署记录相关机制与工程权衡。

Comments 10 pages, 15 references, experience report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19816 2026-08-24 cs.CY 版本更新 50%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 软件智能体 :coding agent(abstract)

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

Comments Changed first line of abstract

详情

展开后加载摘要…

URL PDF HTML 收藏