arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-05 至 2026-02-05 共收录 14 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2602.04296 2026-02-05 cs.SE cs.AI 81%

ProxyWar: Dynamic Assessment of LLM Code Generation in Game Arenas

ProxyWar: 动态评估LLM代码生成在游戏竞技场中的表现

Wenjun Peng, Xinyu Wang, Qi Wu

机构 * adelaide.edu.au(阿德莱德大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 ProxyWar通过在动态游戏环境中评估LLM代码生成的质量,揭示了基准分数与实际性能之间的差异,为算法发现和自适应问题解决研究提供新视角。

Comments ICSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04195 2026-02-05 cs.SE cs.CR 79%

Semantic Consensus Decoding: Backdoor Defense for Verilog Code Generation

语义一致性解码:用于Verilog代码生成的后门防御

Guang Yang, Xing Hu, Xiang Chen, Xin Xia

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出语义一致性解码方法,通过提取功能需求和融合输出分布,有效防御Verilog代码生成中的后门攻击。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04380 2026-02-05 cs.LG cs.AI 62%

Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning

超越KL散度:基于灵活Bregman散度的群体策略优化用于大语言模型推理

Rui Yuan, Mykola Khandoga, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GBMPO框架,通过灵活Bregman散度提升大语言模型在数学推理和代码生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27675 2026-02-05 cs.SE cs.CR cs.LG 62%

On the Difficulty of Selecting Few-Shot Examples for Effective LLM-based Vulnerability Detection

在有效基于LLM的漏洞检测中选择少样本示例的难度

Md Abdul Hannan, Ronghao Ni, Chi Zhang, Limin Jia, Ravi Mangal, Corina S. Pasareanu

机构 * Colorado State University(科罗拉多州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 本文研究了在基于LLM的漏洞检测中选择少样本示例的两种标准,并发现不同编程语言对示例选择的响应不同。

Comments Workshop on LLM Assisted Security and Trust Exploration (LAST-X) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04039 2026-02-05 cs.CR 50%

Evaluating the Vulnerability Landscape of LLM-Generated Smart Contracts

评估LLM生成的智能合约漏洞图景

Hoang Long Do, Nasrin Sohrabi, Muneeb Ul Hassan

专题命中 代码生成 :code generation(abstract)

AI总结 本研究评估了LLM生成的智能合约的安全性,发现其存在严重漏洞,提出缓解措施和开发指南以提高区块链安全。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2602.04226 2026-02-05 cs.SE 79%

Why Agentic-PRs Get Rejected: A Comparative Study of Coding Agents

为何智能代理生成的拉取请求被拒绝:智能代理的比较研究

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Shane Mclntosh, Yasutaka Kamei

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文研究了不同智能代理生成的拉取请求被拒绝的原因差异,发现七种仅出现在智能代理生成PR中的拒绝模式,并提出启发式方法以减少无反馈的拒绝案例。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 79%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04518 2026-02-05 cs.CY cs.AI cs.LG 62%

Learning the Value Systems of Agents with Preference-based and Inverse Reinforcement Learning

基于偏好和逆强化学习的学习代理价值系统

Andrés Holgado-Sánchez, Holger Billhardt, Alberto Fernández, Sascha Ossowski

机构 * Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于偏好和逆强化学习的方法,用于自动从观察和人类示范中学习代理的价值系统,以解决不同用户价值系统差异带来的协议一致性问题。

Comments 42 pages, 5 figures. Published in Journal of Autonomous Agents and Multi-Agent Systems

Journal ref Holgado-Sánchez, A., Billhardt, H., Fernández, A., Ossowski, S. Learning the value systems of agents with preference-based and inverse reinforcement learning. Autonomous Agents Multi-Agent Systems 40, 4 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02122 2026-02-05 cs.CL 57%

Fake News Detection: It's All in the Data!

虚假新闻检测:一切都在数据!

Soveatin Kuntur, Anna Wróblewska, Marcin Paprzycki, Maria Ganzha

机构 * Warsaw University of Technology(华沙技术大学) Systems Research Institute, Polish Academy of Sciences(波兰科学院系统研究所)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 本文综述强调数据集质量与多样性对虚假新闻检测模型的重要性,并提供了一个整合公开数据集的GitHub仓库以促进相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 2 篇

2602.04449 2026-02-05 cs.SE 79%

What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair

基准中有什么?SWE-Bench在自动程序修复中的案例

Matias Martinez, Xavier Franch

专题命中 代码评测 :program repair(title,abstract);分类 cs.SE

AI总结 本文研究了SWE-Bench排行榜上的提交来源、LLM使用情况及行业参与度,揭示了专有LLM在自动程序修复中的主导地位。

Comments Accepted in 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP'26). https://doi.org/10.1145/3786583.3786904

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17489 2026-02-05 cs.CL cs.AI 73%

MapCoder-Lite: Distilling Multi-Agent Coding into a Single Small LLM

MapCoder-Lite:将多智能体编码 distilling 进单一小型 LLM

Woongkyu Lee, Junhee Cho, Jungwook Choi

机构 * Hanyang University(翰阳大学) Samsung SDS(三星SDS)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.AI

AI总结 MapCoder-Lite通过三支柱方法将多智能体编码distilling进单一7B模型,显著提升代码生成性能并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 3 篇

2510.02389 2026-02-05 cs.SE cs.CR cs.LG 62%

From Trace to Line: LLM Agent for Real-World OSS Vulnerability Localization

从痕迹到行:面向真实世界OSS漏洞定位的LLM代理

Haoran Xi, Minghao Shao, Brendan Dolan-Gavitt, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学唐纳德工程学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.LG

AI总结 T2L框架通过基于AST的分块和证据引导细化,实现项目级和行级漏洞定位,提升LLM在开源软件中的精准诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04248 2026-02-05 cs.AI cs.CL 62%

Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search

经验-MCTS:通过双经验蒙特卡洛树搜索实现连续智能体进化

Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu

机构 * JianChengXingYun Technology Co., Ltd.(健成星云科技有限公司)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 经验-MCTS通过双环框架实现连续智能体进化,结合局部探索与全局记忆优化,提升复杂推理任务性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04227 2026-02-05 cs.CV 50%

An Intuitionistic Fuzzy Logic Driven UNet architecture: Application to Brain Image segmentation

直觉模糊逻辑驱动的UNet架构:应用于脑图像分割

Hanuman Verma, Kiho Im, Pranabesh Maji, Akshansh Gupta

机构 * Department of Mathematics, Bareilly College, Bareilly (MJP Rohilkhand University), Uttar Pradesh, India(印度乌塔兰普尔邦巴雷利学院数学系) Division of Newborn Medicine, Fetal Neonatal Neuroimaging and Developmental Science Center, Boston Children’s Hospital, Harvard Medical School, Boston, MA 02115, USA(美国哈佛医学院波士顿儿童医院新生儿医学部) Department of Pediatrics, Harvard Medical School, Boston, MA, USA(美国哈佛医学院儿科系) CSIR–Central Electronics Engineering Research Institute, Pilani 333031, Rajasthan, India(印度拉贾斯坦邦比拉尼中央电子工程研究机构) Academy of Scientific and Innovative Research (AcSIR), Ghaziabad 201002, India(印度德里阿齐亚德瓦学术与创新研究院) CSIR–National Institute of Science Communication and Policy Research, New Delhi, India(印度新德里国家科学传播与政策研究所)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出基于直觉模糊逻辑的UNet架构,用于提升脑图像分割中对不确定性的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏