arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-04 至 2026-02-04 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 10 篇

2602.03806 2026-02-04 cs.LG cs.AI cs.CL cs.SE 83%

Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation

弥合在线与离线强化学习:多轮代码生成的上下文老虎机学习

Ziru Chen, Dongdong Chen, Ruinan Jin, Yingbin Liang, Yujia Xie, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Microsoft(微软)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 Cobalt通过结合在线和离线强化学习,提出一种新的上下文老虎机学习方法,用于多轮代码生成任务,显著提升了模型性能并缓解了奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03557 2026-02-04 cs.SE 79%

Scaling Test-Driven Code Generation from Functions to Classes: An Empirical Study

从函数到类的测试驱动代码生成规模化:一项实证研究

Yunhao Liang, Ruixuan Ying, Shiwen Ni, Zhe Cui

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出一种测试驱动代码生成框架,通过迭代方法提升类级代码生成的正确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02584 2026-02-04 cs.SE cs.AI cs.CR 76%

Constitutional Spec-Driven Development: Enforcing Security by Construction in AI-Assisted Code Generation

宪法式规范驱动开发:通过构建确保AI辅助代码生成中的安全

Srinivas Rao Marri

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI

AI总结 本研究提出宪法规范驱动开发方法,通过在规范层嵌入不可协商的安全原则,有效减少AI生成代码中的安全缺陷,提升开发过程中的安全性。

Comments 15 pages, 2 figures, 5 tables, 11 code listings, 14 references. Includes reference implementation and compliance traceability matrix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02896 2026-02-04 cs.SE 74%

Failure-Aware Enhancements for Large Language Model (LLM) Code Generation: An Empirical Study on Decision Framework

面向大语言模型(LLM)代码生成的失败意识增强:决策框架的实证研究

Jianru Shen, Zedong Peng, Lucy Owen

专题命中 代码生成 :code generation(title);分类 cs.SE

AI总结 本文通过实证研究,提出了一种基于失败特征的决策框架,用于指导大语言模型代码生成中的增强策略选择。

Comments Accepted at SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02888 2026-02-04 cs.CL cs.AI 62%

HALT: Hallucination Assessment via Log-probs as Time series

HALT:通过log-prob作为时间序列进行幻觉评估

Ahmad Shapiro, Karan Taneja, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 HALT通过log-prob时间序列检测幻觉,比Lettuce更高效且兼容专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00294 2026-02-04 cs.LG cs.AI 62%

Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models

免费草稿与验证:迈向无损并行解码的扩散大语言模型

Shutong Wu, Jiawei Zhang

机构 * Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI(计算机科学系,威斯康星大学麦迪逊分校,麦迪逊,WI)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 FreeDave是一种专为DLLMs设计的快速解码算法,通过无损并行解码实现高效推理,无需模型修改或额外模块,提升了推理速度而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03630 2026-02-04 cs.AI 57%

Can LLMs Do Rocket Science? Exploring the Limits of Complex Reasoning with GTOC 12

大语言模型能做火箭科学吗?通过GTOC 12探索复杂推理的极限

Iñaki del Campo, Pablo Cuervo, Victor Rodriguez-Fernandez, Roberto Armellin, Jack Yarndley

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本研究通过GTOC 12竞赛评估大语言模型在复杂轨道优化任务中的表现,发现其在战略规划上能力显著提升,但在实际执行中存在物理一致性等关键问题。

Comments Extended version of the paper presented at AIAA SciTech 2026 Forum. Includes futher experiments, corrections and new appendix

Journal ref Proceedings of the AIAA SciTech 2026 Forum, January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02509 2026-02-04 cs.CY cs.AI 57%

CodeGuard: Improving LLM Guardrails in CS Education

CodeGuard: 提高计算机科学教育中的LLM防护机制

Nishat Raihan, Noah Erdachew, Jayoti Devi, Joanna C. S. Santos, Marcos Zampieri

机构 * George Mason University(乔治·马歇尔大学) University of Oklahoma(俄克拉荷马大学) University of Notre Dame(圣约翰斯大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 CodeGuard通过引入新的分类法、数据集和PromptShield模型,有效提升教育AI系统对不安全提示的检测能力,减少有害代码生成,同时保持教育任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03648 2026-02-04 cs.CR 50%

Can Developers rely on LLMs for Secure IaC Development?

开发者能否依赖LLM进行安全的IaC开发?

Ehsan Firouzi, Shardul Bhatt, Mohammad Ghafari

专题命中 代码生成 :code generation(abstract)

AI总结 研究评估了LLM在安全IaC开发中的能力,发现指导提示能显著提高安全异味检测和生成安全代码的效率,但仍有改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17360 2026-02-04 cs.DC 50%

Cortex: Achieving Low-Latency, Cost-Efficient Remote Data Access For LLM via Semantic-Aware Knowledge Caching

Cortex: 通过语义感知的知识缓存实现低延迟、低成本的远程数据访问用于大语言模型

Chaoyi Ruan, Chao Bi, Kaiwen Zheng, Ziji Shi, Xinyi Wan, Jialin Li

专题命中 代码生成 :code generation(abstract)

AI总结 Cortex通过语义感知的知识缓存架构,实现LLM代理在远程数据访问中的低延迟和低成本,提升吞吐量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2512.10398 2026-02-04 cs.CL cs.AI cs.LG cs.SE 70%

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

孔子代码代理:面向真实世界代码库的可扩展代理构建

Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

机构 * Meta

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 孔子代码代理通过可扩展的代理构建框架,在真实世界软件工程任务中实现高性能,超越现有研究和商业成果。

Comments The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07468 2026-02-04 cs.AI cs.CL cs.LG cs.SE 70%

CP-Agent: Agentic Constraint Programming

CP-Agent:代理约束编程

Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 CP-Agent通过代理工作流实现约束编程问题的高效求解,展示了最少指导优于详细指导,并揭示了任务管理工具对建模任务的双重影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11544 2026-02-04 cs.HC cs.AI cs.CL 62%

Medication counseling with large language models: balancing flexibility and rigidity

利用大语言模型进行用药咨询:在灵活性与严谨性之间取得平衡

Joar Sabel, Mattias Wingren, Andreas Lundell, Sören Andersson, Sara Rosenberg, Susanne Hägglund, Linda Estman, Malin Andtfolk

机构 * Department of Engineering and Information Technology Åbo Akademi University(工程与信息科技系阿博阿卡迪米大学) Experience Lab Åbo Akademi University(经验实验室阿博阿卡迪米大学) Department of Natural and Health Sciences Åbo Akademi University(自然与健康科学系阿博阿卡迪米大学) Department of Caring and Ethics University of Stavanger(护理与伦理系斯塔万格大学)

专题命中 软件智能体 :software agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种利用大语言模型在药房环境中提供用药咨询的原型系统,旨在平衡对话要求与灵活性,减少幻觉并提高响应质量。

Comments Accepted for 2025 IEEE International Conference on Agentic AI (ICA). 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2602.03181 2026-02-04 cs.SE 79%

Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging

通过自我调试合成文件级数据用于单元测试生成的链式思考

Ziyue Hua, Tianyu Chen, Yeyun Gong, Shuai Lu, Peng Cheng, Qinglin Zhu, Yibo He, Yingjie Fu, Wenpin Jiao, Wei Yang, Tao Xie

专题命中 测试生成 :unit test generation(title);repository(abstract);分类 cs.SE

AI总结 通过自我调试合成文件级数据用于单元测试生成,提升测试生成质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2602.03712 2026-02-04 cs.SE 83%

SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring

SWE-Refactor:一个面向真实世界的基于大语言模型的代码重构仓库级基准

Yisen Xu, Jinqiu Yang, Tse-Hsun, Chen

专题命中 代码评测 :repository(title,abstract);code generation(abstract);分类 cs.SE

AI总结 SWE-Refactor是一个面向真实世界的基于大语言模型的代码重构仓库级基准,通过1099个Java项目中的重构实例评估九种LLMs,揭示复杂重构的失败率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02554 2026-02-04 cs.LG cs.AI cs.SE 67%

BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation

BatCoder: 通过回译实现的双向代码-文档自监督学习

Jingwen Xu, Yiyang Lu, Zisu Huang, Changze Lv, Xiaohua Wang, Shizheng Li, Zhibo Xu, Zhengkang Guo, Zhengyuan Wang, Muzhao Tian, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(计算机科学与人工智能学院,复旦大学,上海,中国)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 BatCoder通过回译策略实现代码与文档的双向自监督学习,提升模型在代码生成和文档生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21551 2026-02-04 cs.LG 57%

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

在LLM预训练中“Grokking”?无需测试即可监控记忆到泛化的过程

Ziyue Li, Chenrui Fan, Tianyi Zhou

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,学院公园)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文研究了LLM预训练中“Grokking”现象,通过分析训练数据路径的动态变化,提出两种新度量标准以监控模型泛化能力,无需额外成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 6 篇

2602.02084 2026-02-04 cs.CL cs.SE 81%

Closing the Loop: Universal Repository Representation with RPG-Encoder

闭环:通用仓库表示法与RPG-编码器

Jane Luo, Chengyu Yin, Xin Zhang, Qingtao Li, Steven Liu, Yiming Huang, Jie Wu, Hao Liu, Yangyu Huang, Yu Kang, Fangkai Yang, Ying Xin, Scarlett Li

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.CL

AI总结 RPG-Encoder通过统一表示和闭环推理,实现复杂代码库的高精度理解和生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03798 2026-02-04 cs.SE cs.CL cs.CV 76%

FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation

全栈代理:通过面向开发的测试和仓库反翻译增强全栈网页编码

Zimu Lu, Houxing Ren, Yunqiao Yang, Ke Wang, Zhuofan Zong, Mingjie Zhan, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 仓库级理解 :repository(title);分类 cs.SE、cs.CL

AI总结 FullStack-Agent通过面向开发的测试和仓库反翻译提升全栈网页编码能力,其多代理框架和自我改进方法在多个测试用例中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22984 2026-02-04 cs.AI cs.CL 62%

From Deferral to Learning: Online In-Context Knowledge Distillation for LLM Cascades

从延迟到学习:在线上下文知识蒸馏用于LLM级联

Yu Wu, Shuo Wu, Ye Tao, Yansong Li, Anand D. Sarwate

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Department of Electrical and Computer Engineering, Rutgers University, NJ, USA(电气与计算机工程系,Rutgers大学,新泽西州,美国) Computer Engineering Department, University of Illinois Chicago, Illinois, USA(计算机工程系,伊利诺伊大学芝加哥分校,伊利诺伊州,美国)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 Inter-Cascade通过在线上下文知识蒸馏提升LLM级联性能,实现弱模型在任务中学习,减少强模型调用并提高整体准确率。

Comments 32 pages, 6 figures, 23 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03817 2026-02-04 cs.SD cs.AI 57%

Adaptive Evidence Weighting for Audio-Spatiotemporal Fusion

自适应证据加权用于音频-时空融合

Oscar Ovanger, Levi Harris, Timothy H. Keitt

机构 * Jackson School of Geosciences, University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校地质科学学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 FINCH通过自适应证据融合框架结合预训练音频分类器与结构化时空预测器,提升生物声学分类的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03245 2026-02-04 eess.AS cs.CL 57%

Mići Princ -- A Little Boy Teaching Speech Technologies the Chakavian Dialect

Mići Princ -- 一个男孩教语音技术学习克亚基亚方言

Nikola Ljubešić, Peter Rupnik, Tea Perinčić

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文通过发布《小王子》克亚基亚方言版本的语料库,为语音识别模型适应克亚基亚方言提供数据支持,显著降低识别错误率。

Comments 2 figures, 14 pages, accepted and presented at JTDH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19154 2026-02-04 cs.CV 50%

Lightweight RGB-T Tracking with Mobile Vision Transformers

轻量级RGB-T跟踪与Mobile Vision Transformers

Mahdi Falaki, Maria A. Amer

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Concordia University(康科迪亚大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出了一种基于MobileViT的轻量级RGB-T跟踪器,通过渐进融合框架和可分离混合注意力模型,实现低参数量和高实时性能的多模态跟踪。

Comments Accepted for publication in ICASSP 2026. Implementation Code Available

详情

展开后加载摘要…

URL PDF HTML 收藏