arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-02 至 2025-12-02 共收录 6 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 6 篇

2506.12286 2025-12-02 cs.AI cs.SE 62%

The SWE-Bench Illusion: When State-of-the-Art LLMs Remember Instead of Reason

SWE-Bench 的错觉:当最先进的大语言模型记住而不是推理

Shanchao Liang, Spandan Garg, Roshanak Zilouchian Moghaddam

机构 * Purdue University(普渡大学) Microsoft(微软)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文指出,SWE-Bench 的高表现可能源于记忆而非推理,通过两个诊断任务揭示模型在软件工程任务中的能力限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24616 2025-12-02 cs.CL cs.AI 62%

Eye of Judgement: Dissecting the Evaluation of Russian-speaking LLMs with POLLUX

Judgment Eye: 解剖俄罗斯语LLM评估的POLLUX

Nikita Martynov, Anastasia Mordasheva, Dmitriy Gorbetskiy, Danil Astafurov, Ulyana Isaeva, Elina Basyrova, Sergey Skachkov, Victoria Berestova, Nikolay Ivanov, Valeriia Zanina, Alena Fenogenova

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 POLLUX通过细粒度任务分类和LLM评估器,提供可解释的俄语生成模型评估方法。

Comments short version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01735 2025-12-02 cs.LG 57%

Automating modeling in mechanics: LLMs as designers of physics-constrained neural networks for constitutive modeling of materials

力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模

Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Christian Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) Helmholtz-Zentrum Hereon(海德堡中心) Hamburg University of Technology(汉堡技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03665 2025-12-02 cs.DC cs.AI 57%

LLM & HPC:Benchmarking DeepSeek's Performance in High-Performance Computing Tasks

LLM与HPC:在高性能计算任务中评估DeepSeek的性能

Noujoud Nader, Patrick Diehl, Steve Brandt, Hartmut Kaiser

机构 * Center of Computation and Technology(计算与技术中心) Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文评估了DeepSeek在高性能计算任务中生成代码的能力,发现其在扩展性和执行效率上逊于GPT-4。

Comments 9 pages, 2 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00215 2025-12-02 cs.SE 57%

Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation

解析LLM推理轨迹中的错误:对代码执行模拟的实证研究

Mohammad Abdollahi, Khandaker Rifah Tasnia, Soumit Kanti Saha, Jinqiu Yang, Song Wang, Hadi Hemmati

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究通过实证分析揭示LLM推理轨迹中的错误类型,开发了九类错误分类体系,并展示工具增强推理可有效提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00341 2025-12-02 cs.NE 50%

A Novel Population Initialization Method via Adaptive Experience Transfer for General-Purpose Binary Evolutionary Optimization

一种通过自适应经验迁移的新型通用二进制进化优化群体初始化方法

Zhiyuan Wang, Shengcai Liu, Shaofeng Zhang, Ke Tang

专题命中 代码评测 :repository(abstract)

AI总结 本文提出了一种基于自适应经验迁移的通用二进制优化群体初始化方法,通过少量函数评估生成高质量初始群体,有效提升复杂问题的求解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏