arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-24 至 2026-08-24 共收录 16 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2608.20628 2026-08-24 cs.SE 新提交 79%

Behavior Specification-Guided Program Synthesis for Binary Deobfuscation

行为规范引导的二进制代码反混淆程序合成

Kangchen Zhu, Shangwen Wang, Zhiliang Tian, Zhouyang Jia, Xiaoling Li, Jun Ma, Jie Yu, Xiaoguang Mao

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.SE

AI总结 针对二进制反混淆领域的局限,本文提出BinMirror方法,将二进制反混淆转化为行为规范引导的程序合成任务,在150万个合成混淆二进制文件上的评估显示其性能优于现有基线,单元测试Pass@1达74.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20381 2026-08-24 cs.CL cs.AI cs.HC 新提交 62%

EditPPT: Faithful Long-Deck Slide Editing via Structured Tool-Using Multi-Agent with Dual-Modal Validators

EditPPT:基于结构化工具使用多智能体与双模态验证器的忠实长文档幻灯片编辑

Jiheon Kim, Kyudan Jung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EditPPT多智能体框架,通过PowerPoint COM接口执行局部操作并结合双模态验证,在DeckEdit-Bench基准上实现高执行率等指标,解决长文档幻灯片编辑的级联错误问题。

Comments 30 pages, 7 figures, 17 tables, EMNLP 2026 submitted, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20349 2026-08-24 cs.CL cs.AI 新提交 62%

Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on Quality

提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析

Qipeng Xie, Zi Liang, Jiafei Wu, Yufei Chen, Weizheng Wang, Wenao Ma, Zhong Ming, Haiqin Yang, Kaishun Wu

机构 * Shenzhen Technology University(深圳技术大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang Lab(之江实验室) The Chinese University of Hong Kong(香港中文大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20446 2026-08-24 cs.SE 新提交 57%

Vibe Coding: Practice, Performance, Productivity, and Risk -A State-of-the-Art Review

Vibe编程:实践、性能、生产力与风险——一项最新进展综述

Dominik L. Michels, Mutaz Abu Ghazaleh, Francois Lazzari, Nabil Kassem, Jonathan Klein

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本综述针对2025年提出的Vibe编程,梳理跨学科实证证据,发现其代码生成可靠但故障检测弱,生产力结果因测量方式等差异存在分歧,还存在安全、版权及技能萎缩问题,提出新代码收益真实、成熟代码收益收缩的猜想。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2608.20664 2026-08-24 cs.AI cs.SE 新提交 76%

DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents

DreamBench-SWE:面向软件智能体的多会话记忆卫生基准

Sarthak Singh

专题命中 软件智能体 :software agent(title);分类 cs.SE、cs.AI

AI总结 该研究提出面向软件智能体的多会话记忆卫生基准DreamBench-SWE,通过v2和预注册的v2.1审计,对比不同内存配置的任务完成表现,验证其作为可执行基准的有效性,同时明确相关内存机制的表现情况。

Comments 67 pages. Public benchmark and evidence release: this https URL (https://github.com/iroiro147/dreambench-swe/releases/tag/v2.1.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20341 2026-08-24 cs.AI cs.SE 新提交 73%

SDAD: Spec-Driven Agentic Development for the AI-Native SDLC

SDAD:面向AI原生软件开发生命周期的规范驱动智能体开发

Vu Hung Nguyen, Thanh Nguyen

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出规范驱动智能体开发(SDAD)模型,对比传统敏捷开发,扩展团队角色、量化治理等,论证智能体开发需将工程规范转移至上游规范环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21311 2026-08-24 cs.SE 新提交 57%

AI-to-AI Code Reviews of GitHub Pull Requests

GitHub 拉取请求的 AI 对 AI 代码审查

Niruthiha Selvanayagam, Taher A. Ghaleb

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 该研究构建大规模 AI 对 AI 代码审查数据集,分析 GitHub 上 AI 智能体生成 PR 的审查情况,发现跨产品审查占比约 1.6%且增速快,审查输出因配置而异,闭环 AI 对 AI 审查呈增长趋势但占比仍低。

Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20420 2026-08-24 cs.AI q-bio.NC 新提交 57%

Categorical AI phenomenology: A first-person approach

范畴论的AI现象学:一种第一人称进路

Robert Prentner

机构 * Institute of Humanities, ShanghaiTech University(上海科技大学人文学院) Association for Mathematical Consciousness Science(数学意识科学协会)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出一种以现象学为核心的人工意识研究进路,通过范畴论建模第一人称结构,将Q-networks视为智能体-世界交互的关系性接口,为接口意识提供严谨框架,契合4E认知方法。

Comments 38 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20359 2026-08-24 cs.CL 新提交 57%

Self-Speculation for Faster Reasoning Models

用于更快推理模型的自推测技术

Ravisri Valluri, Tung Nguyen, Aditya Grover

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20342 2026-08-24 cs.AI cs.MA 新提交 57%

PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure

PrimeAgentOrchestrator:用于个人AI基础设施的内存初始化智能体生成器

Myron Koch (Peak Summit Labs)

机构 * Peak Summit Labs(峰汇实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出PrimeAgentOrchestrator系统,生成预加载用户个人数据库相关记忆的Claude Code实例,并行查询两类记忆后端融合结果,管理智能体全生命周期,经四个月部署记录相关机制与工程权衡。

Comments 10 pages, 15 references, experience report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2608.20904 2026-08-24 cs.RO cs.DB cs.SE 新提交 57%

Scalable Distributed Simulation-Based Testing for Automated Driving Systems

面向自动驾驶系统的可扩展分布式基于仿真的测试

Christian Geller, Benedikt Haas, Lutz Eckstein

机构 * RWTH Aachen University(亚琛工业大学) Institute for Automotive Engineering (ika)(汽车工程研究所(ika))

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本文提出一种DevOps驱动的端到端框架,在轻量级Kubernetes集群上自动化CARLA场景测试的构建与分布式执行,200个场景测试的端到端时间较基线提速超8倍,为ADS可扩展仿真测试提供支撑。

Comments 14 pages; Accepted to be published as part of the 17. Uni-DAS e.V. Workshop "Fahrerassistenz und automatisiertes Fahren", September 29-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2608.21107 2026-08-24 cs.AI cs.SE 新提交 62%

Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda

大型语言模型在软件工程与软件安全交叉领域:一项以证据为中心的结构化调查与研究议程

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究调查了LLMs在软件工程与软件安全交叉领域的进展,提出保证框架,识别有效性威胁与最低报告协议,制定研究议程,主张以任务适配证据而非单一基准评判模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20614 2026-08-24 cs.AI 新提交 57%

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills

评估技能,而非仅评估智能体:智能体驱动的技能持续评估

Christopher Kevin, Narendran Raghavan, Jean-Francois Puget, Roshni Malani, Meghana Puvvadi, Moshe Abramovitch, Mohit Gupta, Rama Akkiraju, Subodh Prabhu, Yogesh Dangi, Wei Luo, Seong Hee Lee

机构 * NVIDIA(英伟达)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 该研究提出ACES框架,通过配对实际 trials等方式评估技能附加价值,实验表明其能发现扫描式审核无法观测的信号,开源实现已在NVIDIA SkillEvaluator中提供。

Comments 15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: this https URL (https://github.com/NVIDIA/SkillEvaluator)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20406 2026-08-24 cs.LG stat.AP 新提交 57%

Machine Learning and ARIMA Model Averaging for Adaptive Public Health Forecasting: Comparative Evaluation and an Ontario COVID-19 Case Study

机器学习与ARIMA模型平均法用于自适应公共卫生预测:比较评估及安大略省COVID-19案例研究

Yushu Zou, Ye Li, Johra Moosa, Martin Grunnill, Samir N. Patel, Venkata R. Duvvuri

机构 * Public Health Ontario(安大略省公共卫生局) Dalla Lana School of Public Health, University of Toronto(多伦多大学达拉·拉纳公共卫生学院) University of Toronto(多伦多大学) York University(约克大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本研究评估ARIMA、随机森林、XGBoost模型,提出MLAMA集成方法,基于安大略省COVID-19数据验证其预测性能更优,支持按操作条件选择预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 2 篇

2608.20637 2026-08-24 cs.CR cs.AI 新提交 57%

ARQ: Agentic CodeQL Query Refinement for C/C++ Vulnerability Detection

ARQ:用于C/C++漏洞检测的智能CodeQL查询优化框架

Chunyi Wang, Yunfei Ke, Junfeng Yang, Yun-Yun Tsai, Penghui Li

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出ARQ智能框架,利用合成C/C++程序的执行证据和LLM优化CodeQL查询,无需标注数据等,优化后查询的真阳性最多提升119.8%,还修复了长期悬而未决的问题并发现新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20343 2026-08-24 cs.LG stat.AP 新提交 57%

Bankruptcy Prediction via Hybrid Resampling and Stacking Ensemble Techniques with Explainable Artificial Intelligence (XAI)-Driven Analysis

结合可解释人工智能(XAI)分析的混合重采样与堆叠集成技术的破产预测

Obu-Amoah Ampomah, Edmund Fosu Agyemang, Kofi Acheampong, Louis Agyekum, Enock Adu Bonsu, Eric Nyarko

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本研究提出整合多技术的破产预测框架,在不平衡金融数据中优化少数类检测,经实验验证了模型性能,可助力财务困境企业的早期预警系统建设。

Comments 24 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏