arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-01-30 至 2026-01-30 共收录 21 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2601.21469 2026-01-30 cs.SE cs.AI 81%

Adaptive Confidence Gating in Multi-Agent Collaboration for Efficient and Optimized Code Generation

多智能体协作中的自适应置信度门控:用于高效优化的代码生成

Haoji Zhang, Yuzhe Li, Zhenqiang Liu, Chenyang Liu, Shenyang Zhang, Yi Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 DebateCoder通过多智能体协作和自适应置信度门控机制,提升小型语言模型在复杂逻辑任务中的代码生成效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21511 2026-01-30 cs.AI cs.NE cs.SE 62%

LLaMEA-SAGE: Guiding Automated Algorithm Design with Structural Feedback from Explainable AI

LLaMEA-SAGE: 通过可解释AI的结构反馈引导自动算法设计

Niki van Stein, Anna V. Kononova, Lars Kotthoff, Thomas Bäck

机构 * LIACS, Leiden University(莱顿大学信息科学研究中心) University of St Andrews(圣安德鲁大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 LLaMEA-SAGE通过可解释AI的结构反馈引导自动算法设计,提升搜索效率和性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22047 2026-01-30 cs.CL 57%

On the Paradoxical Interference between Instruction-Following and Task Solving

关于指令遵循与任务解决之间的悖论性干扰

Yunjia Qi, Hao Peng, Xintong Shi, Amy Xin, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文揭示指令遵循可能干扰LLMs任务解决能力,并提出SUSTAINSCORE指标量化此干扰,通过实验表明添加自我显而易见约束会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20879 2026-01-30 cs.SE 57%

A Survey on Large Language Model Impact on Software Evolvability and Maintainability: the Good, the Bad, the Ugly, and the Remedy

对大型语言模型对软件可变性与可维护性影响的综述:好坏优劣及解决方法

Bruno Claudino Matias, Savio Freire, Juliana Freitas, Felipe Fronchetti, Kostadin Damevski, Rodrigo Spinola

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文综述了大型语言模型对软件可变性与可维护性的影响,分析了其带来的积极影响、潜在风险及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17865 2026-01-30 cs.CL 57%

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

D模型和E模型:大语言模型采样行为中的多样性-稳定性权衡

Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中D模型与E模型在采样行为上的多样性-稳定性权衡,为任务应用中的模型选择提供了指导。

Comments 12 pages, 10 figures. Accepted by WWW'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2601.21649 2026-01-30 cs.LG cs.AI cs.CL cs.SE 85%

SWE-Spot: Building Small Repo-Experts with Repository-Centric Learning

SWE-Spot:构建基于仓库的小型专家

Jinjun Peng, Magnus Saebo, Tianjun Zhong, Yi-Jie Cheng, Junfeng Yang, Baishakhi Ray, Simin Chen, Yangruibo Ding

机构 * Department of Computer Science, Columbia University, New York, USA(哥伦比亚大学计算机科学系) Computer Science Department, University of California, Los Angeles, California, USA(加州大学洛杉矶分校计算机科学系)

专题命中 软件智能体 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Spot提出仓库导向学习范式,通过参数知识获取训练小型专家模型,提升代码任务表现并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21276 2026-01-30 cs.SE cs.AI cs.HC 62%

More Code, Less Reuse: Investigating Code Quality and Reviewer Sentiment towards AI-generated Pull Requests

更多代码,更少重用:调查代码质量和审查员对AI生成的拉取请求的态度

Haoming Huang, Pongchai Jaisri, Shota Shimizu, Lingfeng Chen, Sota Nakashima, Gema Rodríguez-Pérez

机构 * Institute of Science Tokyo(东京科学研究所) Nara Institute of Science and Technology(奈良科学技術大學) Ritsumeikan University(立命館大學) Kyushu University(九州大學) University of British Columbia(不列颠哥伦比亚大學)

专题命中 软件智能体 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究调查了AI生成的拉取请求在代码质量和审查员情绪方面的表现,发现AI生成代码存在冗余问题,但审查员对其情绪更中性或积极,揭示了人机协作中的技术债务积累问题。

Comments Accepted to MSR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21194 2026-01-30 cs.SE 57%

Human-Agent versus Human Pull Requests: A Testing-Focused Characterization and Comparison

人类-智能体 vs 人类拉请:以测试为中心的特征分析与比较

Roberto Milanese, Francesco Salzano, Angelica Spina, Antonio Vitale, Remo Pareschi, Fausto Fasano, Mattia Fazzini

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文研究了人类与智能体协作在软件测试中的影响,发现智能体协作能显著增加测试范围和新测试添加,但对测试质量无明显影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2510.03217 2026-01-30 cs.SE cs.AI 84%

Abstain and Validate: A Dual-LLM Policy for Reducing Noise in Agentic Program Repair

回避与验证:一种双LLM策略用于减少代理程序修复中的噪声

José Cambronero, Michele Tufano, Sherry Shi, Renyao Wei, Grant Uy, Runxiang Cheng, Chin-Jung Liu, Shiying Pan, Satish Chandra, Pat Rondon

机构 * Google, USA(谷歌公司) Meta, USA(Meta公司)

专题命中 程序修复 :program repair(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出双LLM策略,通过bug回避和补丁验证减少代理程序修复中的噪声,提升修复成功率和可靠性。

Comments Accepted to the 2026 IEEE/ACM 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP '26)

Journal ref 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2601.20882 2026-01-30 cs.SE cs.AI cs.CR 62%

DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle

DevOps-Gym: 在软件DevOps周期中评估AI代理的基准测试

Yuheng Tang, Kaijie Zhu, Bonan Ruan, Chuqi Zhang, Michael Yang, Hongwei Li, Suyue Guo, Tianneng Shi, Zekun Li, Christopher Kruegel, Giovanni Vigna, Dawn Song, William Yang Wang, Lun Wang, Yangruibo Ding, Zhenkai Liang, Wenbo Guo

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学) UC Berkeley(加州大学伯克利分校) Google(谷歌) UC Los Angeles(加州大学洛杉矶分校)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 DevOps-Gym通过700+真实任务评估AI代理在完整DevOps周期中的能力,揭示其在问题解决和测试生成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 6 篇

2601.21115 2026-01-30 cs.CL cs.AI 62%

Multi-task Code LLMs: Data Mix or Model Merge?

多任务代码LLM:数据混合还是模型合并?

Mingzhi Zhu, Boris Sobolev, Rahul Krishna, Raju Pavuluri, Stacy Patterson, Michele Merler

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了数据混合与模型合并在多任务代码LLM中的效果,发现模型合并在大模型规模下表现更优,而数据混合在小规模更有效,为资源受限场景提供了高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00527 2026-01-30 cs.SE cs.AI 62%

A Hierarchical Imprecise Probability Approach to Reliability Assessment of Large Language Models

一种分层不精确概率方法用于大型语言模型的可靠性评估

Robab Aghazadeh-Chakherlou, Qing Guo, Siddartha Khastgir, Peter Popov, Xiaoge Zhang, Xingyu Zhao

机构 * WMG, University of Warwick(沃里克大学工业与制造业学院) Center for Frontier AI Research, A*STAR(前沿人工智能研究中心) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Center for Software Reliability, City St George's, University of London(伦敦大学圣乔治学院软件可靠性中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出HIP-LLM,一种分层不精确概率框架,用于更准确地评估大型语言模型的可靠性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22132 2026-01-30 cs.LG 57%

Pay for Hints, Not Answers: LLM Shepherding for Cost-Efficient Inference

为提示付费,而非答案:用于高效推断的LLM牧师

Ziming Dong, Hardik Sharma, Evan O'Toole, Jaya Prakash Champati, Kui Wu

机构 * Department of Computer Science, University of Victoria, Victoria, Canada(维多利亚大学计算机科学系) Department Of Information Technology, Manipal University, Manipal, India(马那尔大学信息科技系)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 LLM牧师通过请求LLM的短提示来提高SLM的准确性,显著降低推断成本,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA 57%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19510 2026-01-30 cs.RO cs.CL 57%

ALRM: Agentic LLM for Robotic Manipulation

ALRM:用于机器人操作的代理LLM

Vitor Gaboardi dos Santos, Ibrahim Khadraoui, Ibrahim Farhat, Hamza Yous, Samy Teffahi, Hakim Hacid

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 ALRM提出了一种基于LLM的代理框架,通过ReAct推理循环实现机器人操作的模块化执行,支持代码生成和工具规划模式,实验表明其在多步骤推理和语言多样性任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02507 2026-01-30 cs.CV cs.RO 50%

Keeping it Local, Tiny and Real: Automated Report Generation on Edge Computing Devices for Mechatronic-Based Cognitive Systems

保持本地化、小巧和现实:面向机电认知系统的边缘计算设备自动化报告生成

Nicolas Schuler, Lea Dewald, Jürgen Graf

专题命中 代码评测 :repository(abstract)

AI总结 本文提出了一种基于边缘计算设备的自动化报告生成方法,利用本地模型实现多模态传感器数据处理,以提升机电认知系统在不同环境中的评估效率与隐私保护。

Comments 6 pages, 4 figures, 1 table; accepted for MECATRONICS-REM 2025 International Conference, PARIS, FRANCE December 3-5 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 4 篇

2505.05029 2026-01-30 cs.AI cs.MA 57%

Reputation as a Solution to Cooperation Collapse in LLM-based MASs

声誉作为解决基于大语言模型的多智能体系统合作崩溃的解决方案

Siyue Ren, Wanli Fu, Xinkun Zou, Chen Shen, Yi Cai, Chen Chu, Zhen Wang, Shuyue Hu

机构 * School of Mechanical Engineering, Northwestern Polytechnical University(西北工业大学机械工程学院) School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络安全学院) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(西北工业大学人工智能、光学和电子学(iOPEN)学院) Kyushu University(九州大学) South China University of Technology(华南理工大学) Yunnan University of Finance and Economics(云南财经大学) Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 RepuNet通过动态双层声誉框架解决基于大语言模型的多智能体系统中的合作崩溃问题,促进并维持合作。

Comments Published as a conference paper at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20230 2026-01-30 cs.CL cs.HC 57%

Unit-Based Agent for Semi-Cascaded Full-Duplex Dialogue Systems

基于单元的代理用于半级联全双工对话系统

Haoyuan Yu, Yuxuan Chen, Minjie Cai

机构 * Hunan University(湖南大学) Gongdao Technology(公道科技) Jilin University(吉林大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文提出基于单元的半级联全双工对话系统,利用多模态大语言模型和辅助模块实现高效对话处理,实验显示其在挑战赛中表现优异。

Comments ICASSP 2026 (Grant Challenge). https://github.com/yu-haoyuan/fd-badcat

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15919 2026-01-30 cs.SE 57%

Does Functional Package Management Enable Reproducible Builds at Scale? Yes

功能包管理是否能够实现大规模可重复构建?是

Julien Malka, Stefano Zacchiroli, Théo Zimmermann

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文通过大规模研究Nix功能包管理器,验证了大规模可重复构建的可行性,发现位级可重复性率高达69%-91%,重新构建率超过99%。

Journal ref 22nd International Conference on Mining Software Repositories, Apr 2025, Ottawa, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12361 2026-01-30 cs.AI cs.MS math.NT 57%

The Ramanujan Library -- Automated Discovery on the Hypergraph of Integer Relations

拉马努金图书馆——整数关系超图上的自动发现

Itay Beit-Halachmi, Ido Kaminer

机构 * The Ramanujan Machine Team, Faculty of Electrical and Computer Engineering Technion - Israel Institute of Technology(拉马努金机器团队,电气与计算机工程学院,技术离子理工学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出一个基于超图的数学常数图书馆,利用PSLQ算法自动发现常数间的新关系,包括对π和e关系的扩展。

Comments 20 pages, 7 figures

Journal ref ICLR 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 程序分析与验证 1 篇

2601.21096 2026-01-30 cs.AI cs.LG cs.PL 67%

Magellan: Autonomous Discovery of Novel Compiler Optimization Heuristics with AlphaEvolve

Magellan:利用AlphaEvolve自主发现新型编译器优化启发式方法

Hongzheng Chen, Alexander Novikov, Ngân Vũ, Hanna Alam, Zhiru Zhang, Aiden Grossman, Mircea Trofin, Amir Yazdanbakhsh

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Cornell University(康奈尔大学)

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.AI、cs.LG、cs.PL

AI总结 Magellan通过AlphaEvolve自主发现新型编译器优化启发式方法,提升编译器优化效率与性能。

Comments Accepted to C4ML@CGO'26

详情

展开后加载摘要…

URL PDF HTML 收藏