arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-01-26 至 2026-01-26 共收录 12 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2512.22255 2026-01-26 cs.AI cs.LG 62%

Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks

思维的形状:当分布比正确性更重要时在推理任务中的表现

Abhranil Chandra, Ayush Agrawal, Arian Hosseini, Sebastian Fischmeister, Rishabh Agarwal, Navin Goyal, Aaron Courville

机构 * University of Waterloo(滑铁卢大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) MILA - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Microsoft Research India(微软印度研究院) Google DeepMind(谷歌DeepMind) Periodic Labs(周期实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 通过训练合成数据集中的链式思考轨迹,即使最终答案错误,也能提升语言模型的推理能力,表明分布比正确性更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06000 2026-01-26 cs.SE 57%

Prompting in Practice: Investigating Software Practitioners' Use of Generative AI Tools

实践中的提示:调查软件从业者使用生成式AI工具的方式

Daniel Otten, Trevor Stalnaker, Nathan Wintersgill, Oscar Chaparro, Denys Poshyvanyk

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究调查软件从业者在实际开发中使用生成式AI工具的提示策略与实践,揭示其在代码生成、调试等任务中的应用现状及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14693 2026-01-26 cs.CL 57%

I-MCTS: Enhancing Agentic AutoML via Introspective Monte Carlo Tree Search

I-MCTS:通过反思蒙特卡洛树搜索增强代理自动机器学习

Zujie Liang, Feng Wei, Wujiang Xu, Lin Chen, Yuxi Qian, Xinhui Wu

机构 * Ant Group(蚂蚁集团) Rutgers University(罗格斯大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 I-MCTS通过反思蒙特卡洛树搜索提升代理AutoML性能,实现4%的绝对性能提升。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2601.16238 2026-01-26 cs.SE cs.AI cs.LG 75%

VibeTensor: System Software for Deep Learning, Fully Generated by AI Agents

VibeTensor:由AI代理完全生成的深度学习系统软件

Bing Xu, Terry Chen, Fengzhe Zhou, Tianqi Chen, Yangqing Jia, Vinod Grover, Haicheng Wu, Wei Liu, Craig Wittenbrink, Wen-mei Hwu, Roger Bringmann, Ming-Yu Liu, Luis Ceze, Michael Lightstone, Humphrey Shi

机构 * NVIDIA

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 VibeTensor是首个由AI代理完全生成的深度学习系统软件,实现了PyTorch风格的张量库及CUDA内存管理,展示了AI辅助软件工程的里程碑进展。

Comments Open-source: https://github.com/NVLabs/vibetensor

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16839 2026-01-26 cs.SE 57%

AI builds, We Analyze: An Empirical Study of AI-Generated Build Code Quality

AI构建,我们分析:对AI生成构建代码质量的实证研究

Anwar Ghammam, Mohamed Almukhtar

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本研究通过分析AI生成的构建代码质量,探讨其在构建系统中的影响,并发现AI生成代码既可能引入质量问题,也部分消除了现有问题,同时大部分代理提交被开发者接受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16507 2026-01-26 cs.SE 57%

REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering

REprompt:基于需求工程的智能软件开发提示生成

Junjie Shi, Weisong Sun, Zhenpeng Chen, Zhujun Wu, Xiaohong Chen, Zhi Jin, Yang Liu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 REprompt是一种基于需求工程的多代理提示优化框架,旨在通过根植需求工程原则来优化系统和用户提示,提升智能软件开发中的提示生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 4 篇

2601.16520 2026-01-26 cs.CV cs.AI cs.CL 62%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15728 2026-01-26 cs.AI cs.SE 62%

Benchmarking Text-to-Python against Text-to-SQL: The Impact of Explicit Logic and Ambiguity

对文本到Python与文本到SQL的基准测试:显式逻辑和歧义的影响

Hangle Hu, Chenyu Hou, Bin Cao, Ruizhe Li

机构 * Zhejiang University of Technology(浙江工业大学) University of Aberdeen(阿伯丁大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出BIRD-Python基准测试,通过逻辑完成框架解决文本到Python与SQL的性能差异问题,证明Python在分析代理中的可行性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16354 2026-01-26 cs.CR cs.AI 57%

NOIR: Privacy-Preserving Generation of Code with Open-Source LLMs

NOIR:基于开源LLM的隐私保护代码生成

Khoa Nguyen, Khiem Ton, NhatHai Phan, Issa Khalil, Khang Tran, Cristian Borcea, Ruoming Jin, Abdallah Khreishah, My T. Thai

机构 * New Jersey Institute of Technology(新泽西理工学院) Hamad Bin Khalifa University(哈利法大学) Kent State University(肯特州立大学) University of Florida(佛罗里达大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 NOIR通过客户端本地处理和隐私保护机制,实现对开源LLM生成代码的隐私保护,显著提升代码生成性能和安全性。

Comments To appear at Usenix Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14122 2026-01-26 cs.CL cs.CY cs.ET 57%

Benchmarking LLMs for Political Science: A United Nations Perspective

对政治科学的LLM进行基准测试:一个联合国视角

Yueqing Liang, Liangwei Yang, Chen Wang, Congying Xia, Rui Meng, Xiongxiao Xu, Haoran Wang, Ali Payani, Kai Shu

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出联合国基准(UNBench),用于评估LLMs在政治科学中的能力,涵盖联合国决策过程的三个阶段。

Comments This paper has been accepted at AAAI 2026 as an oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 1 篇

2412.13847 2026-01-26 cs.AI cs.LG 62%

A Concept-Centric Approach to Multi-Modality Learning

面向多模态学习的概念中心方法

Yuchong Geng, Ao Tang

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院) Cornell University(康奈尔大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种以概念为中心的多模态学习框架,通过共享的概念空间和模态特定的投影模型,实现高效的知识迁移与跨模态适应。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026. Official version: https://openreview.net/forum?id=8WAAPP32c7

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他AI编程 1 篇

2601.15892 2026-01-26 cs.CL 57%

Stable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Model

Stable-DiffCoder:推动代码扩散大语言模型的前沿

Chenghao Fan, Wen Heng, Bo Li, Sichen Liu, Yuxuan Song, Jing Su, Xiaoye Qu, Kai Shen, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 其他AI编程 :code model(abstract);分类 cs.CL

AI总结 Stable-DiffCoder通过基于扩散的训练方法,在代码生成任务中超越了传统自回归模型,提升了代码建模的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏