arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-17 至 2026-02-17 共收录 24 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 7 篇

2602.14054 2026-02-17 cs.CL 79%

LogitsCoder: Towards Efficient Chain-of-Thought Path Search via Logits Preference Decoding for Code Generation

LogitsCoder:通过logits偏好解码实现高效的思维链搜索以提升代码生成

Jizheng Chen, Weiming Zhang, Xinyi Dai, Weiwen Liu, Kounianhua Du, Yasheng Wang, Ruiming Tang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab Shanghai(华为诺亚实验室)

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL

AI总结 LogitsCoder通过logit级控制机制提升代码生成的推理效率和质量,实现高效且有效的思维链搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14717 2026-02-17 cs.PL 74%

Optimal Program Synthesis via Abstract Interpretation

通过抽象解释实现最优程序合成

Stephen Mell, Steve Zdancewic, Osbert Bastani

专题命中 代码生成 :program synthesis(title);分类 cs.PL

AI总结 本文提出了一种基于抽象解释的框架,用于在领域特定语言中高效合成最优程序,通过A*搜索和抽象转换器提升可扩展性。

Journal ref Proc. ACM Program. Lang. 8, POPL, Article 16 (January 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14451 2026-02-17 cs.AI cs.CL 62%

Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning

基于先例的推理:通过测试时先例学习缓解大推理模型中的过度思考

Qianyue Wang, Jinwu Hu, Huanxiang Lin, Bolin Chen, Zhiquan Wen, Yaofo Chen, Yu Rong, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(黄埔实验室) DAMO Academy(达摩院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 PIR通过测试时先例学习,优化大推理模型的推理过程,减少冗余探索并提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 62%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15756 2026-02-17 cs.SE cs.AI 62%

Automated Proof Generation for Rust Code via Self-Evolution

通过自我进化实现Rust代码的自动证明生成

Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

机构 * Peking University(北京大学) Microsoft Research(微软研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California Irvine(加州大学 Irvine 分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 SAFE框架通过自我进化循环和自我调试机制,提升开源模型自动编写Rust代码证明的能力,准确率达52.52%

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13280 2026-02-17 cs.AI 57%

BEAGLE: Behavior-Enforced Agent for Grounded Learner Emulation

BEAGLE:行为约束的地面学习者模拟代理

Hanchen David Wang, Clayton Cohn, Zifan Xu, Siyuan Guo, Gautam Biswas, Meiyi Ma

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 BEAGLE 通过整合自我调节学习理论和三种技术创新,有效模拟学生学习行为,实现对真实学习轨迹的高还原度复现。

Comments paper under submission at IJCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16701 2026-02-17 cs.AI 57%

An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems

基于大语言模型的代理框架用于解决复杂车辆路径问题

Ni Zhang, Zhiguang Cao, Jianan Zhou, Cong Zhang, Yew-Soon Ong

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的代理框架AFL,实现复杂车辆路径问题的完全自动化,通过分解任务和协调代理提升解决方案的可靠性和可行性。

Comments Accepted by iclr2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2602.13363 2026-02-17 cs.CR cs.AI 79%

Assessing Spear-Phishing Website Generation in Large Language Model Coding Agents

评估大型语言模型编码代理生成钓鱼网站的能力

Tailia Malloy, Tegawende F. Bissyande

机构 * University of Luxembourg, Interdisciplinary Center for Security, Reliability, and Trust (SnT), Trustworthy Software Engineering Group (TruX)(卢森堡大学,安全、可靠与信任跨学科中心(SnT),可信软件工程组(TruX))

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型在生成钓鱼网站代码方面的能力和潜在风险,通过比较不同模型生成危险代码库的能力,构建了包含200个网站代码库的数据集。

Comments 18 Pages, 7 Figures, 1 Table. Accepted to the conference Human Computer Interaction International

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14296 2026-02-17 cs.AI cs.SE 62%

AutoWebWorld: Synthesizing Infinite Verifiable Web Environments via Finite State Machines

AutoWebWorld: 通过有限状态机合成无限可验证的网页环境

Yifan Wu, Yiran Peng, Yiyu Chen, Jianhao Ruan, Zijie Zhuang, Cheng Yang, Jiayi Zhang, Man Chen, Yenchi Tseng, Zhaoyang Yu, Liang Chen, Yuyao Zhai, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Peking University(北京大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 AutoWebWorld通过有限状态机合成可验证的网页环境,实现自动化搜索与验证流程,提升WebGUI代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14293 2026-02-17 cs.LG cs.AI 62%

KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement Learning

KernelBlaster: 通过记忆增强的上下文强化学习实现持续的跨任务CUDA优化

Kris Shengjun Dong, Sahil Modi, Dima Nikiforov, Sana Damani, Edward Lin, Siva Kumar Sastry Hari, Christos Kozyrakis

机构 * NVIDIA University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 KernelBlaster通过记忆增强的上下文强化学习框架提升CUDA代码优化性能,实现跨多个GPU架构世代的高效优化。

Comments 15 pages, 33 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 2 篇

2602.13611 2026-02-17 cs.SE cs.AI 62%

From What to How: Bridging User Requirements with Software Development Using Large Language Models

从‘是什么’到‘如何做’:利用大型语言模型弥合用户需求与软件开发之间的鸿沟

Xiao He, Ru Chen, Jialun Cao

机构 * University of Science and Technology Beijing(北京科技大学) Hong Kong University of Science and Technology(香港科学大学) University of Science(科学大学)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出DesBench基准测试,评估LLMs在软件设计相关任务中的表现,揭示LLMs在代码生成、面向对象建模及测试用例设计方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13987 2026-02-17 cs.SE 57%

ATTest: Agent-Driven Tensor Testing for Deep Learning Library Modules

基于代理的张量测试:用于深度学习库模块的单元测试生成

Zhengyu Zhan, Ye Shang, Jiawei Liu, Chunrong Fang, Quanjun Zhang, Zhenyu Chen

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 ATTest通过基于代理的框架生成深度学习库模块的高效单元测试,显著提升测试覆盖率和稳定性。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 4 篇

2602.13921 2026-02-17 cs.LG cs.AI cs.SE 82%

GREPO: A Benchmark for Graph Neural Networks on Repository-Level Bug Localization

GREPO:图神经网络在仓库级Bug定位上的基准

Juntong Wang, Libin Chen, Xiyuan Wang, Shijia Kang, Haotong Yang, Da Zheng, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 GREPO是首个用于仓库级Bug定位的GNN基准,包含86个Python仓库和47294个Bug修复任务,展示了GNN在Bug定位中的优越性能。

Comments 46 pages, 14figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12185 2026-02-17 cs.SE cs.CL cs.LG 75%

EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming

EVALOOOP:一种以自一致性为中心的大型语言模型编程鲁棒性评估框架

Sen Fang, Weiyuan Ding, Mengshi Zhang, Zihao Chen, Bowen Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 EVALOOOP通过自一致性反馈循环评估LLM在编程任务中的鲁棒性,利用ASL度量揭示模型在持续自指代转换中的语义保持能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19666 2026-02-17 cs.CL 57%

RoD-TAL: A Benchmark for Answering Questions in Romanian Driving License Exams

RoD-TAL:罗马尼亚驾照考试问答的基准测试

Andrei Vlad Man, Răzvan-Alexandru Smădu, Cristian-George Craciun, Dumitru-Clementin Cercel, Florin Pop, Mihaela-Claudia Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest, Faculty of Automatic Control and Computers(波兰技术大学布加勒斯特分校) Technical University of Munich(慕尼黑技术大学) National Institute for Research & Development in Informatics - ICI Bucharest(信息研究所-布加勒斯特) Paris 1 Panthéon-Sorbonne University(巴黎1大学) University of Bucharest(布加勒斯特大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 RoD-TAL是一个用于评估大型语言模型和视觉语言模型在罗马尼亚驾照法律问答中性能的多模态基准数据集,通过文本和图像问答任务验证了领域微调和推理优化对考试通过率的影响。

Comments 41 pages, 30 figures, Accepted by the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13671 2026-02-17 cs.MA cs.AI 57%

MAS-on-the-Fly: Dynamic Adaptation of LLM-based Multi-Agent Systems at Test Time

MAS-on-the-Fly: 在测试时动态适应基于大语言模型的多智能体系统

Guangyi Liu, Haojun Lin, Huan Zeng, Heng Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Ant Group(蚂蚁集团)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MASFly通过动态适应机制在测试时优化多智能体系统,利用检索增强和经验引导机制提升任务适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 6 篇

2602.14106 2026-02-17 cs.CR cs.AI 57%

Anticipating Adversary Behavior in DevSecOps Scenarios through Large Language Models

通过大型语言模型预见DevSecOps场景中的对手行为

Mario Marín Caballero, Miguel Betancourt Alonso, Daniel Díaz-López, Angel Luis Perales Gómez, Pantaleone Nespoli, Gregorio Martínez Pérez

机构 * Department of Information and Communications Engineering, University of Murcia(信息与通信工程系,穆尔西亚大学) School of Engineering, Science and Technology, Universidad del Rosario(工程、科学与技术学院,罗萨里奥大学) Department of Computers Engineering and Technology, University of Murcia(计算机工程与技术系,穆尔西亚大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出通过大型语言模型与安全混沌工程结合,自动化构建攻击防御树以预见并防御对手行为。

Comments 8 pages, 3 figures, paper in proceedings of the X National Cybersecurity Research Conference (JNIC) in Zaragoza, Spain, June, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13388 2026-02-17 astro-ph.IM astro-ph.SR 56%

Dyad: a binary-star dynamics and statistics library for Python

Dyad:一个用于Python的双星动力学与统计库

Amery Gration

专题命中 仓库级理解 :repository(abstract,comments)

AI总结 Dyad 是一个用于双星动力学和统计分析的 Python 库,提供概率分布模型和二体系统模拟工具。

Comments Published in The Journal of Open Source Software. Software repository at https://github.com/AmeryGration/dyad

Journal ref Journal of Open Source Software, 11(118), 9011 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14582 2026-02-17 cs.CV 50%

YOLO26: A Comprehensive Architecture Overview and Key Improvements

YOLO26:全面架构概述及关键改进

Priyanto Hidayatullah, Refdinal Tubagus

专题命中 仓库级理解 :repository(abstract)

AI总结 YOLO26通过去除DFL、端到端无NMS推理、ProgLoss+STAL和MuSGD优化器等改进,提升推理速度并实现边缘设备上的实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14493 2026-02-17 cs.CV cs.GR 50%

Gaussian Mesh Renderer for Lightweight Differentiable Rendering

轻量可微渲染的高斯网格渲染器

Xinpeng Liu, Fumio Okura

机构 * The University of Osaka(大阪大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 提出一种轻量可微网格渲染器,利用3DGS高效光栅化过程,实现更平滑的梯度优化,提升视图合成的效率与质量。

Comments IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026). GitHub: https://github.com/huntorochi/Gaussian-Mesh-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13946 2026-02-17 quant-ph 50%

Homodyne Detection of Temporally Resolved Quantum States

同向检测时间分辨量子态

Owen Sandner, Brendan Mackey, Yuyang Liu, Connor Kupchak, Andrew MacRae

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出了一种基于同向检测的时间分辨量子态测量方法,并通过算法模拟和开源代码实现了该方法的完整应用。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13356 2026-02-17 nucl-th 50%

MFGSB (ver. 1.0): Computer code for self-consistent mean-field calculations of atomic nuclei using Gaussian expansion method

MFGSB (ver. 1.0): 基于高斯展开法的原子核自洽平均场计算计算机代码

H. Nakada

专题命中 仓库级理解 :repository(abstract)

AI总结 MFGSB 1.0 版基于高斯展开法实现原子核自洽平均场计算,提供新的计算工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他AI编程 2 篇

2602.14093 2026-02-17 cs.AI cs.LG 62%

GUI-GENESIS: Automated Synthesis of Efficient Environments with Verifiable Rewards for GUI Agent Post-Training

GUI-GENESIS: 自动合成具有可验证奖励的高效环境以实现GUI代理训练

Yuan Cao, Dezhi Ran, Mengzhou Wu, Yuzhe Guo, Xin Chen, Ang Li, Gang Cao, Gong Zhi, Hao Yu, Linyi Li, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE SCS, Peking University, Beijing, China Tencent Inc., Shenzheng, China Hong Kong University of Science Department of Computer Science, University of Texas at Dallas, Richardson, USA School of Computing Science, Simon Fraser University, Burnaby, BC, Canada

专题命中 其他AI编程 :code model(abstract);分类 cs.AI、cs.LG

AI总结 GUI-GENESIS通过自动合成高效GUI训练环境并提供可验证奖励,显著提升了GUI代理的训练效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13240 2026-02-17 cs.AI cs.SE 62%

AST-PAC: AST-guided Membership Inference for Code

AST-PAC: 基于抽象语法树的成员推断

Roham Koohestani, Ali Al-Kaswan, Jonathan Katzy, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他AI编程 :code model(abstract);分类 cs.SE、cs.AI

AI总结 AST-PAC通过利用抽象语法树生成语法有效的校准样本,提升代码模型的成员推断性能,尤其在处理复杂代码时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏