arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-11 至 2026-02-11 共收录 20 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2602.09856 2026-02-11 cs.CV cs.AI cs.CL cs.HC 81%

Code2World: A GUI World Model via Renderable Code Generation

Code2World: 通过可渲染代码生成实现一个GUI世界模型

Yuhao Zheng, Li'an Zhong, Yi Wang, Rui Dai, Kaikui Liu, Xiangxiang Chu, Linyuan Lv, Philip Torr, Kevin Qinghong Lin

机构 * University of Science(科学大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) University of Oxford(牛津大学) Sun Yat-sen University(中山大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL、cs.AI

AI总结 Code2World通过可渲染代码生成实现高保真UI预测,提升Android导航性能

Comments github: https://github.com/AMAP-ML/Code2World project page: https://amap-ml.github.io/Code2World/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09112 2026-02-11 cs.AI 79%

A Small-Scale System for Autoregressive Program Synthesis Enabling Controlled Experimentation

一个小型系统用于自回归程序合成,以实现受控实验

Russ Webb, Jason Ramapuram

机构 * Apple(苹果公司)

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.AI

AI总结 Cadmus系统通过低成本模型实现复杂程序合成任务,展示其在整数算术任务中的优越性能并揭示大模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 62%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10092 2026-02-11 cs.CL 57%

Quantum-Audit: Evaluating the Reasoning Limits of LLMs on Quantum Computing

量子审计:评估大语言模型在量子计算上的推理极限

Mohamed Afane, Kayla Laufer, Wenqi Wei, Ying Mao, Junaid Farooq, Ying Wang, Juntao Chen

机构 * Fordham University(福特汉姆大学) University of Michigan-Dearborn(密歇根大学-迪尔本分校) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 Quantum-Audit通过2700个问题评估大语言模型在量子计算概念理解上的推理能力,发现顶级模型在专家问题上表现不如LLM生成问题,且在高级主题上准确率显著下降。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13047 2026-02-11 cs.OS cs.SE 57%

Sharpen the Spec, Cut the Code: A Case for Generative File System with SYSSPEC

细化规范,削减代码:一种生成性文件系统案例

Qingyuan Liu, Mo Zou, Hengbin Zhang, Dong Du, Yubin Xia, Haibo Chen

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出SYSSPEC框架,通过生成性文件系统利用LLM生成和演变文件系统,展示SPECFS在并发性和正确性上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11097 2026-02-11 cs.CL 57%

The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs

面具背后的魔鬼:扩散语言模型的新兴安全漏洞

Zichen Wen, Jiashu Qu, Zhaorun Chen, Xiaoya Lu, Dongrui Liu, Zhiyuan Liu, Ruixi Wu, Yicun Yang, Xiangqi Jin, Haoyun Xu, Xuyang Liu, Weijia Li, Chaochao Lu, Jing Shao, Conghui He, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Chicago(芝加哥大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 DIJA揭示了扩散语言模型的安全漏洞,通过构造对抗性提示利用双向建模和并行解码机制,使有害内容在对齐训练模型中得以生成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2602.09185 2026-02-11 cs.SE cs.AI 81%

AIDev: Studying AI Coding Agents on GitHub

AIDev:研究GitHub上的AI编码代理

Hao Li, Haoxiang Zhang, Ahmed E. Hassan

机构 * Queen's University(女王大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 AIDev是一个大规模数据集,包含来自五个AI代理的GitHub pull requests,用于研究AI在软件工程中的应用、开发者生产力及人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06268 2026-02-11 cs.SE cs.AI 81%

Automated QoR improvement in OpenROAD with coding agents

在OpenROAD中通过编码代理实现自动化QoR提升

Amur Ghose, Junyeong Jang, Andrew B. Kahng, Jakang Lee

机构 * UC San Diego(UC圣地亚哥大学)

专题命中 软件智能体 :coding agent(title);repository(abstract);分类 cs.SE、cs.AI

AI总结 AuDoPEDA通过自主编码代理在OpenROAD中实现EDA技术的自动化改进,显著提升QoR指标。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2405.01466 2026-02-11 cs.SE 79%

A Systematic Literature Review on Large Language Models for Automated Program Repair

基于大型语言模型的自动程序修复系统文献综述

Quanjun Zhang, Chunrong Fang, Yang Xie, YuXiang Ma, Weisong Sun, Yun Yang, Zhenyu Chen

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 本文系统综述了2020-2025年间基于大型语言模型的自动程序修复技术,分析了其应用、挑战与未来方向。

Comments Accepted to ACM Transactions on Software Engineering and Methodology (TOSEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2602.08146 2026-02-11 cs.SE 74%

Test vs Mutant: Adversarial LLM Agents for Robust Unit Test Generation

测试与突变:对抗性LLM代理用于鲁棒性单元测试生成

Pengyu Chang, Yixiong Fang, Silin Chen, Yuling Shi, Beijun Shen, Xiaodong Gu

专题命中 测试生成 :unit test generation(title);分类 cs.SE

AI总结 AdverTest通过对抗性代理提升单元测试生成的鲁棒性,提高故障检测率和覆盖率

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 3 篇

2602.09540 2026-02-11 cs.SE 57%

SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?

SWE-Bench Mobile: 大语言模型代理能否开发行业级移动应用?

Muxin Tian, Zhe Wang, Blair Yang, Zhenwei Tang, Kunlun Zhu, Honghua Dong, Hanchen Li, Xinni Xie, Guangjing Wang, Jiaxuan You

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 SWE-Bench Mobile评估大语言模型代理在开发行业级移动应用中的能力,发现商业代理表现优于开源替代品,且简单提示策略更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15935 2026-02-11 cs.DB cs.CL cs.CR 57%

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS: 一种多语言评估基准,用于代理性能和安全

Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究部) Fujitsu Limited(富士通有限公司) Cohere

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。

Comments Accepted to EACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02076 2026-02-11 cs.AI cs.MA 57%

Leveraging LLM Agents and Digital Twins for Fault Handling in Process Plants

利用大语言模型代理和数字孪生进行过程厂故障处理

Milapji Singh Gill, Javal Vyas, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Institute of Automation Technology Helmut Schmidt University Hamburg(海因里希·施密特大学汉堡自动化技术研究所) Autonomous Industrial Systems Lab, Imperial College London(伦敦帝国理工学院自主工业系统实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型代理和数字孪生技术,实现过程厂故障的自动处理与纠正,通过模拟验证有效缓解管道堵塞问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 7 篇

2310.10887 2026-02-11 cs.SE cs.PL 81%

The Stackage Repository: An Exploratory Study of its Evolution

Stackage仓库:对其演变的探索性研究

Paul Leger, Felipe Ruiz, Nicolás Sepúlveda, Ismael Figueroa, Nicolás Cardozo

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.PL

AI总结 本文通过分析Stackage仓库22次发布中的51,716个软件包,探讨其演变过程,重点研究monad软件包的使用和依赖关系。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09071 2026-02-11 cs.SE cs.AI cs.LG 67%

DRAGON: Robust Classification for Very Large Collections of Software Repositories

DRAGON:用于非常大规模软件仓库集合的鲁棒分类

Stefano Balla, Stefano Zacchiroli, Thomas Degueule, Jean-Rémy Falleri, Romain Robbes

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 DRAGON通过利用版本控制系统中的轻量信号实现对大规模软件仓库的鲁棒分类,提升分类准确率并释放大规模开源数据集用于未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09570 2026-02-11 cs.CL cs.AI cs.IR 62%

LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval

LEMUR:一种用于多语言法律嵌入模型检索鲁棒微调的语料库

Narges Baba Ahmadi, Jan Strich, Martin Semmann, Chris Biemann

机构 * Hub of Computing and Data Science (HCDS) University of Hamburg(计算与数据科学中心(HCDS)乌姆斯大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 LEMUR通过构建多语言法律语料库并微调嵌入模型,提升了多语言法律检索的鲁棒性和准确性,尤其在低资源语言中表现显著。

Comments Accepted at EACL SRW 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09552 2026-02-11 cs.CL cs.AI cs.IR 62%

Comprehensive Comparison of RAG Methods Across Multi-Domain Conversational QA

跨多领域对话问答中RAG方法的全面比较

Klejda Alushi, Jan Strich, Chris Biemann, Martin Semmann

机构 * Hub of Computing and Data Science (HCDS) University of Hamburg(计算与数据科学中心(HCDS)乌姆斯大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文通过跨多领域对话问答数据集的全面比较,发现简单策略在多轮对话中表现更优,而复杂方法未必有效,强调检索策略与数据集结构的匹配至关重要。

Comments Accepted to EACL SRW 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08712 2026-02-11 cs.CL cs.AI cs.DC 62%

A Survey on Parallel Text Generation: From Parallel Decoding to Diffusion Language Models

关于并行文本生成的综述:从并行解码到扩散语言模型

Lingzhe Zhang, Liancheng Fang, Chiming Duan, Minghua He, Leyi Pan, Pei Xiao, Shiyu Huang, Yunpeng Zhai, Xuming Hu, Philip S. Yu, Aiwei Liu

机构 * Peking University(北京大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Tsinghua University(清华大学) XPENG Alibaba Group(阿里巴巴集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了并行文本生成技术,分析了基于AR和非AR的方法,评估了其在速度、质量和效率上的权衡,并指出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08493 2026-02-11 cs.CR cs.AI 57%

LLM-based Vulnerable Code Augmentation: Generate or Refactor?

基于LLM的易受攻击代码增强:生成或重构?

Dyna Soumhane Ouchebara, Stéphane Dupont

机构 * University of Mons - Computer science department(蒙斯大学-计算机科学系)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出基于LLM的漏洞代码增强方法,通过生成或重构技术提升漏洞分类器性能,实验表明混合策略效果最佳。

Comments 15 pages, Accepted by ESAAN 2026, version with added appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09635 2026-02-11 physics.flu-dyn 50%

Assessment of jet inflow conditions on the development of supersonic jet flows

对超音速射流流场发展的影响的评估

Diego F. Abreu, Joao Luiz F. Azevedo, Carlos Junqueira-Junior

专题命中 仓库级理解 :repository(abstract)

AI总结 本文通过大涡模拟研究了超音速射流中流入条件对流场发展的影响,发现稳态粘性流入在射流入口附近表现最显著,同时提供了高保真的数据库供科学界使用。

Journal ref Physics of Fluids 1 February 2026; 38 (2): 026109

详情

展开后加载摘要…

URL PDF HTML 收藏