代码大模型 / AI 编程 - arXivDaily 专题

2606.06133 2026-06-18 cs.SE cs.AI cs.LG cs.LO 版本更新专题 90

TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成

Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

专题命中代码生成：TLA+形式化规范合成，偏好优化提升通过率

AI总结提出 TLA-Prover 模型，结合监督微调和基于修复的组相对策略优化，在 TLC 模型检查器上实现 TLA+ 规范合成，Gold/Diamond 级别通过率达 30%，约为未调优基线的 3.5 倍。

Comments 12 pages, 5 tables, 3 figures. Accepted at the 21st International Conference on Software Technologies (ICSOFT 2026)

URL PDF HTML

2606.18286 2026-06-18 cs.LG 新提交专题 85

CODEBLOCK: Learning to Supervise Code at the Right Granularity

CODEBLOCK: 学习在正确的粒度上监督代码

Zhijie Deng, Ling Li, Jinlong Pang, Kaiqin Hu, Qi Xuan, Zhaowei Zhu, Jiaheng Wei

专题命中代码生成：提出CodeBlock框架，结构感知稀疏监督提升代码生成微调。

AI总结提出CodeBlock框架，通过选择结构完整的代码块而非孤立token进行稀疏监督，在仅使用1.9%监督token的情况下，在六个代码生成基准上取得优于全token微调的效果。

URL PDF HTML

2511.00802 2026-06-18 cs.SE cs.CL cs.LG 版本更新专题 85

GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents

GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化

Jie JW Wu, Ayanda Patrick Herlihy, Ahmad Saleem Mirza, Ali Afoud, Fatemeh Fard

专题命中代码生成：利用LLM代理自动修改代码优化离线策略评估。

AI总结提出GrowthHacker基准，利用LLM代理自动迭代修改代码以优化离线策略评估（OPE）实现，在Open Bandit Pipeline和Scope-RL上评估多种框架，证明基于LLM的代理可作为自动增长黑客持续改进OPE系统。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

URL PDF HTML

2606.19315 2026-06-18 cs.LG 新提交专题 80

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

Diffusion-Proof：超越自回归生成的正式定理证明配方

Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

专题命中代码生成：扩散语言模型用于形式定理证明

AI总结提出Diffusion-Proof框架，首次将扩散语言模型应用于形式定理证明，通过全证明生成和局部校正方法，在ProofNet和MiniF2F上分别提升1.61%和6.14%，并解决了一个DeepSeek-Prover-V2-7B无法解决的IMO问题。

URL PDF HTML

2606.19042 2026-06-18 cs.SE cs.AI 新提交专题 80

Where Did the Variability Go? From Vibe Coding to Product Lines by Regeneration

可变性去哪了？从氛围编码到通过再生的产品线

Xhevahire Tërnava

专题命中代码生成：AI驱动编程，可变性再生。

AI总结研究AI驱动编程（氛围编码）中可变性缺失问题，提出通过再生实现可变性（VbR）方法，让LLM作为推导引擎生成无死代码的变体二进制。

Comments VARIABILITY 2026

URL PDF HTML

2606.18293 2026-06-18 cs.SE cs.AI 新提交专题 80

Vibe Coding Ate My Homework: An evaluation of AI approaches to greenfield software engineering and programming

Vibe Coding 吃掉我的作业：AI 方法在全新软件工程与编程中的评估

Callum Barbour

专题命中代码生成：评估AI编程（vibe coding）在软件工程中的可行性。

AI总结本文评估了“氛围编码”（用自然语言提示编程）在全新软件工程任务中的可行性，并分析了现有基准，通过开发 Python 简单独立编程任务评估套件提供见解。

Comments 10 pages, 2 figures

URL PDF HTML

2606.19257 2026-06-18 cs.CL 新提交专题 70

DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models

DreamReasoner-8B：面向扩散推理模型的块大小课程学习

Zirui Wu, Lin Zheng, Jiacheng Ye, Shansan Gong, Xueliang Zhao, Yansong Feng, Wei Bi, Lingpeng Kong

专题命中代码生成：在代码推理基准上评估

AI总结提出块大小课程学习，通过从细粒度到粗粒度的渐进训练，解决块扩散语言模型在长链推理中性能差距问题，DreamReasoner-8B在数学和代码推理上达到与Qwen3-8B相当的水平。

URL PDF HTML

2606.18425 2026-06-18 cs.SE cs.AI cs.DC 新提交专题 70

From Specification to Execution: AI Assisted Scientific Workflow Management

从规范到执行：AI辅助的科学工作流管理

Komal Thareja, Hamza Safri, Rajiv Mayani, Anirban Mandal, Ewa Deelman

专题命中代码生成：利用LLM生成工作流代码

AI总结提出一种AI辅助方法，通过规范驱动的工作流生成、自动化调试和分布式执行，结合Pegasus与MCP层，实现从自然语言到大规模科学工作流的端到端管理。

URL PDF HTML