arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-28 至 2026-08-28 共收录 14 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2608.26588 2026-08-28 cs.CR cs.SE 新提交 74%

Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation

未言明即不安全?基于大语言模型的RTL代码生成中的隐式安全义务

Guang Yang, Xing Hu, Xiang Chen, Xin Xia

专题命中 代码生成 :code generation(title);分类 cs.SE

AI总结 该研究针对LLM生成RTL代码的隐式安全问题,构建了SECRTL-GEN基准,提出神经符号框架RTL-Obliger,可显著提升LLM生成RTL的安全与功能通过率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27017 2026-08-28 cs.IR 新提交 71%

ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

ProRetrieval:通过可执行程序合成学习编排混合搜索

Chengsong You, Zhen Sun, Yunhai Hu, Junwei Zhou, Xiaoyu Cao, Binyu Li, Ziyan Zhao, Weiyao Wang, Liren Lu, Zhijie Ye, Yumo Cao, Yitao Long, Yiwei Xu, Qiyi Jiang, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yiran Zou, Nan Du

专题命中 代码生成 :program synthesis(title)

AI总结 ProRetrieval 将语言模型作为检索编排器,通过混合 DSL 合成可执行程序,在两个新基准上训练 Qwen3-4B,其 4B 模型在电商、邮件检索任务中优于 GPT-5.5 等主流模型及各类基线。

Comments 15 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26557 2026-08-28 cs.SE 新提交 70%

DeepRepro: State-Aware Subplanning for Paper-to-Code Reproduction in Evolving Repositories

DeepRepro:面向演化仓库中论文到代码复现的状态感知子规划

Hongru Song, Ruqing Zhang, Jiafeng Guo, Xueqi Cheng, Maarten de Rijke

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 针对现有论文到代码复现系统因静态规划易出现不一致的问题,提出DeepRepro状态感知框架,通过动态生成子规划并结合编排与监控,在PaperBench Code-Dev上表现优于基线

Comments Accepted by CIKM2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27148 2026-08-28 cs.SE 新提交 57%

AgentDV: Closed-Loop Agentic AI for Hardware Design Verification

AgentDV:用于硬件设计验证的闭环智能体AI

Navya Goli, Junzhe Liu, Zhenge Jia, Umamaheswara Rao Tida

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 AgentDV是用于自动RTL验证的闭环智能体AI框架,通过三项关键技术优化,在三类LLM上显著提升了测试平台的通过率与代码、分支覆盖度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26110 2026-08-28 cs.DC cs.AI 新提交 57%

Exploring the Role of LLMs in HPC Programming: A Survey

探索大语言模型(LLM)在高性能计算(HPC)编程中的作用:一项综述

Strahinja Ljaljevic, Josep Jorba, Sergio Iserte

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本综述梳理了LLM在HPC编程五大类任务中的应用,指出通用LLM在串行等任务表现尚可但分布式范式不足,领域专用模型准确率更高但范围狭窄,LLM短期内无法取代HPC专家,将成为软件开发的强大合作者,二者融合是长期共同演化过程。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2608.26602 2026-08-28 cs.SE cs.CL 新提交 81%

The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning

千图假说:仓库级代码推理中任务条件关系实例化的可检验假说

Fei Ding

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL

AI总结 针对仓库级代码推理的上下文限制与关系图维护问题,该研究提出带任务条件关系实例化的仅实体外部接口,经DeepSeek-V4-Flash和SWE-bench Verified评估,双层索引方案在零预构建边时成功率达95.6%。

Comments 9 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26218 2026-08-28 cs.AI cs.SE 新提交 62%

Same Model, Different Harness: Different Coding-Agent Results

相同模型,不同工具链:编码智能体的结果差异

Sydney Lewis

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文探究模型与任务固定时,工具链改变对编码智能体结果的影响,发现特定工具链配置可提升模型在编码基准的表现,故编码智能体评估需将模型与工具链共同视为求解器。

Comments 24 pages, 9 figures. Software and study artifacts: this https URL (https://github.com/sydches/yuj)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26130 2026-08-28 cs.CL cs.IR 新提交 57%

Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses

智能体不进行分页:面向大语言模型工具响应的首块选择

Tatiana Petrova, Andrei Mazniak, Radu State

机构 * SnT, University of Luxembourg(卢森堡大学SnT(卢森堡大学安全、可靠性与信任中心))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 该研究针对LLM编码智能体的工具响应首块选择问题,发现提升首块Top1准确率不会系统性提升下游准确率,无参数关键词评分器可提升p₁但不影响下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 2 篇

2608.26149 2026-08-28 cs.AI cs.LG 新提交 62%

Methodological and Conceptual Framework for 5D Multi-Table Analysis: A Unified Approach for Complex Data Reuse

用于五维多表分析的方法与概念框架:复杂数据复用的统一方法

Edouard Lansiaux, Hugo Kazzi, Aurélien Loison, Slim Hammadi, Emmanuel Chazard

机构 * CHU de Lille(里尔大学中心医院) Lille Centrale Institute(里尔中央理工学院) Lille University(里尔大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出关系超图Transformer(RHT)架构,用于解决复杂关系数据的多表学习问题,在Synthea数据集上验证其生成语义连贯嵌入的能力,计划后续在MIMIC-IV上开展临床验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26235 2026-08-28 cs.AI cs.PF 新提交 57%

The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts

推理成本:不同任务类型与部署场景下大语言模型推理的令牌经济学

Sachin Gopal Wani, Ajay Dholakia, David Ellison

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 该研究提出令牌经济得分(TES)指标,通过151组实证分析发现任务结构比难度更影响推理效率,推理投入存在收益递减,应按需选择性启用大语言模型推理。

Comments 15 pages, 8 figures and tables, accepted at the 2026 TPCTC Conference and will be published at Performance Evaluation and Benchmarking (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 4 篇

2608.27125 2026-08-28 cs.SE 新提交 57%

AROMA+: A Study of Factors Affecting Reproducible Builds in the Maven Ecosystem

AROMA+:Maven生态系统中影响可复现构建的因素研究

Mehdi Keshani, Amirhossein Rahmati, Mohammad Hossein Aref, Abbas Heydarnoori

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究针对Maven生态系统可复现构建研究不足的问题,开发工具AROMA+自动获取相关信息,准确率达99.8%,实现32%软件包自动可复现,贡献部分软件包至Reproducible Central并公开数据集与工具。

Comments Extended version of a paper accepted at FSE 2024 (ACM International Conference on the Foundations of Software Engineering). Currently under review at Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27100 2026-08-28 cs.SE 新提交 57%

Mutation Testing for Reproducibility Safeguards in Machine Learning Research Software: An Empirical Study

机器学习研究软件中用于可复现性保障的突变测试:一项实证研究

Ilya Shulepov

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究以MLReproMutate为工具,对39个机器学习研究仓库开展实证研究,发现现有验证工作流仅能检测8.7%的可复现性相关突变,提出可复现性导向的突变测试作为补充评估方式。

Comments 27 pages. Software and frozen empirical artifacts available at this https URL (https://doi.org/10.5281/zenodo.22126120)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26911 2026-08-28 eess.SP 新提交 50%

autowerkstatt4null: An Off-Board-Diagnostics Ecosystem for Car-Workshops

autowerkstatt4null:面向汽车维修厂的车外诊断生态系统

Stephan Bökelman, Rene Glitza, Meihui Huang, Odin Holmes, Lukas Jakubczyk, Tabea Röthemeyer

专题命中 仓库级理解 :repository(abstract)

AI总结 该项目推出autowerkstatt4null生态系统,为独立汽车维修厂提供AI驱动的联邦诊断技术,通过模块化测量平台等创新助力维修厂获得高级诊断能力,提升行业竞争力与可持续性。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26358 2026-08-28 econ.GN 新提交 50%

An Anonymized Urn-Based Experimental Dataset on Decision-Making under Risk and Ambiguity

基于瓮模型的风险与模糊性下决策的匿名化实验数据集

Václav Kratochvíl, Radim Jiroušek, Klára Šimůnková, Simona Bažantová

专题命中 仓库级理解 :repository(abstract)

AI总结 本文发布了风险与模糊性决策实验的匿名化数据集,含246名参与者的4486条记录,支持重复研究、模糊态度模型比较及行为稳定性分析。

Comments 16 pages, 1 figure. Data descriptor accompanying an anonymized experimental dataset on decision-making under risk and ambiguity

详情

展开后加载摘要…

URL PDF HTML 收藏