arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-02 至 2025-12-02 共收录 21 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2507.12284 2025-12-02 cs.SE cs.AI cs.CL 82%

MERA Code: A Unified Framework for Evaluating Code Generation Across Tasks

MERA Code: 一个统一的框架,用于评估跨任务的代码生成

Artem Chervyakov, Alexander Kharitonov, Pavel Zadorozhny, Adamenko Pavel, Rodion Levichev, Dmitrii Vorobev, Dmitrii Salikhov, Aidar Valeev, Alena Pestova, Maria Dziuba, Ilseyar Alimova, Artem Zavgorodnev, Aleksandr Medvedev, Stanislav Moiseev, Elena Bruches, Daniil Grebenkin, Roman Derunets, Vikulov Vladimir, Anton Emelyanov, Dmitrii Babaev, Vladimir V. Ivanov, Valentin Malykh, Alena Fenogenova

机构 * SberAI ITMO University(ITMO大学) MWS AI(MWS人工智能) T-Technologies Rostelecom Siberian Neuronets(西伯利亚神经网络) Skoltech Innopolis University(Innopolis大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 MERA Code是一个新的评估框架,专门用于评估代码生成模型在俄语中的实际编程能力,通过11个任务和8种编程语言,提供开源工具和评分系统,以提升代码生成模型的评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12899 2025-12-02 cs.SE cs.CL cs.LG 82%

A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation

基于语义的优化方法用于修复大语言模型:代码生成的案例研究

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(墨尔本大学) Technical University of Munich(慕尼黑技术大学) Chongqing University(重庆大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 本文提出STAR方法,通过基于语义的优化修复大语言模型,提升代码生成的准确性和效率。

Comments 13 pages, 6 figure, 8 tables, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01010 2025-12-02 cs.MA cs.AI cs.LG cs.SE physics.comp-ph physics.flu-dyn 67%

Chain of Unit-Physics: A Primitive-Centric Approach to Scientific Code Synthesis

单元物理链:一种以基础原理为中心的科学代码合成方法

Vansh Sharma, Venkat Raman

机构 * University of Michigan(密歇根大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本研究提出单元物理链框架,通过以基础原理为中心的多代理系统,有效解决科学代码生成中的可靠性问题,实现高精度和高效能的代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03492 2025-12-02 cs.LG cs.AI cs.CL 67%

Teaching Language Models to Critique via Reinforcement Learning

通过强化学习教学语言模型进行批评

Zhihui Xie, Jie Chen, Liyu Chen, Weichao Mao, Jingjing Xu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CTRL框架,通过强化学习训练批评模型以提升代码生成的准确性和性能,实现迭代改进和误差缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 62%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20793 2025-12-02 cs.CV cs.AI 57%

Rendering-Aware Reinforcement Learning for Vector Graphics Generation

面向渲染的强化学习用于矢量图形生成

Juan A. Rodriguez, Haotian Zhang, Abhay Puri, Aarash Feizi, Rishav Pramanik, Pascal Wichmann, Arnab Mondal, Mohammad Reza Samsami, Rabiul Awal, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

机构 * ServiceNow Research(ServiceNow研究机构) Mila ÉTS Montréal(蒙特利尔ÉTS) Polytechnique Montréal(蒙特利尔Polytechnique) Columbia University(哥伦比亚大学) Stony Brook University(石溪大学) Apple(苹果公司) Google Research(谷歌研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) McGill University(麦吉尔大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出RLRF方法,通过利用渲染反馈提升自回归VLMs中SVG生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02203 2025-12-02 cs.AI 57%

GraphIC: A Graph-Based In-Context Example Retrieval Model for Multi-Step Reasoning

GraphIC: 一种基于图的上下文示例检索模型用于多步推理

Jiale Fu, Yaqing Wang, Simeng Han, Jiaming Fan, Xu Yang

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 GraphIC是一种基于图的上下文示例检索模型,通过推理意识的表示和专门相似性度量提升LLM在多步推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00214 2025-12-02 cs.CL 57%

Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis

迈向基于语料库的代理LLM用于多语言语法分析

Matej Klemen, Tjaša Arčon, Luka Terčon, Marko Robnik-Šikonja, Kaja Dobrovoljc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院) University of Ljubljana, Faculty of Arts(卢布尔雅那大学艺术学院) Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出基于语料库的代理LLM框架,用于多语言语法分析,通过数据驱动推理提升语法探究的可解释性和扩展性。

Comments Pre-print, submission under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2512.00611 2025-12-02 cs.CL 57%

Prism: A Minimal Compositional Metalanguage for Specifying Agent Behavior

Prism:一种最小的组合金属言用于指定代理行为

Franck Binard, Vanja Kljajevic

机构 * Deloitte AI(德勤人工智能) University of Oslo(奥斯陆大学)

专题命中 软件智能体 :software agent(abstract);分类 cs.CL

AI总结 Prism通过组合性金属言为代理行为提供最小化规格,结合领域特定词汇与工具,实现可检查和可执行的策略定义。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 6 篇

2506.12286 2025-12-02 cs.AI cs.SE 62%

The SWE-Bench Illusion: When State-of-the-Art LLMs Remember Instead of Reason

SWE-Bench 的错觉:当最先进的大语言模型记住而不是推理

Shanchao Liang, Spandan Garg, Roshanak Zilouchian Moghaddam

机构 * Purdue University(普渡大学) Microsoft(微软)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文指出,SWE-Bench 的高表现可能源于记忆而非推理,通过两个诊断任务揭示模型在软件工程任务中的能力限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24616 2025-12-02 cs.CL cs.AI 62%

Eye of Judgement: Dissecting the Evaluation of Russian-speaking LLMs with POLLUX

Judgment Eye: 解剖俄罗斯语LLM评估的POLLUX

Nikita Martynov, Anastasia Mordasheva, Dmitriy Gorbetskiy, Danil Astafurov, Ulyana Isaeva, Elina Basyrova, Sergey Skachkov, Victoria Berestova, Nikolay Ivanov, Valeriia Zanina, Alena Fenogenova

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 POLLUX通过细粒度任务分类和LLM评估器,提供可解释的俄语生成模型评估方法。

Comments short version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01735 2025-12-02 cs.LG 57%

Automating modeling in mechanics: LLMs as designers of physics-constrained neural networks for constitutive modeling of materials

力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模

Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Christian Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) Helmholtz-Zentrum Hereon(海德堡中心) Hamburg University of Technology(汉堡技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03665 2025-12-02 cs.DC cs.AI 57%

LLM & HPC:Benchmarking DeepSeek's Performance in High-Performance Computing Tasks

LLM与HPC:在高性能计算任务中评估DeepSeek的性能

Noujoud Nader, Patrick Diehl, Steve Brandt, Hartmut Kaiser

机构 * Center of Computation and Technology(计算与技术中心) Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文评估了DeepSeek在高性能计算任务中生成代码的能力,发现其在扩展性和执行效率上逊于GPT-4。

Comments 9 pages, 2 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00215 2025-12-02 cs.SE 57%

Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation

解析LLM推理轨迹中的错误:对代码执行模拟的实证研究

Mohammad Abdollahi, Khandaker Rifah Tasnia, Soumit Kanti Saha, Jinqiu Yang, Song Wang, Hadi Hemmati

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究通过实证分析揭示LLM推理轨迹中的错误类型,开发了九类错误分类体系,并展示工具增强推理可有效提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00341 2025-12-02 cs.NE 50%

A Novel Population Initialization Method via Adaptive Experience Transfer for General-Purpose Binary Evolutionary Optimization

一种通过自适应经验迁移的新型通用二进制进化优化群体初始化方法

Zhiyuan Wang, Shengcai Liu, Shaofeng Zhang, Ke Tang

专题命中 代码评测 :repository(abstract)

AI总结 本文提出了一种基于自适应经验迁移的通用二进制优化群体初始化方法,通过少量函数评估生成高质量初始群体,有效提升复杂问题的求解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 6 篇

2512.01630 2025-12-02 cs.SE 57%

Package Dashboard: A Cross-Ecosystem Framework for Dual-Perspective Analysis of Software Packages

Package Dashboard: 一个跨生态系统的软件包双视角分析框架

Ziheng Liu, Runzhi He, Minghui Zhou

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 Package Dashboard是一个跨生态系统的软件包分析框架,通过整合元数据、漏洞信息和社区健康指标,实现全面的双视角风险评估,提升开源生态系统的透明性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02138 2025-12-02 cs.CL 57%

Misalignment of Semantic Relation Knowledge between WordNet and Human Intuition

词网与人类直觉之间语义关系知识的不一致

Zhihan Cao, Hiroaki Yamada, Simone Teufel, Takenobu Tokunaga

机构 * Institute of Science Tokyo(东京科学研究所) University of Cambridge(剑桥大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 研究发现词网与人类直觉在语义关系知识上存在系统性不一致,影响其应用与改进。

Comments Accepted by Global WordNet Conference 2025

Journal ref Proceedings of the 13th Global Wordnet Conference (GWC2025), pages 25-36

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00104 2025-12-02 physics.flu-dyn cs.LG stat.ML 57%

Learning with Physical Constraints

带有物理约束的学习

Miguel A. Mendez, Jan van Den Berghe, Manuel Ratz, Matilde Fiore, Lorenzo Schena

机构 * von Karman Institute for Fluid Dynamics(冯·卡门流体动力学研究所)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本研究通过三个玩具问题展示了如何利用物理约束进行回归,涵盖超分辨率、湍流建模和系统识别等应用。

Comments Chapter 3 from Machine Learning for Fluid Dynamics (ISBN 978-2875162090). Based on the VKI-ULB lecture series ''Machine Learning for Fluid Dynamics,'' held in Brussels in February 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00823 2025-12-02 astro-ph.GA astro-ph.CO 50%

Investigating the Correlation between Dark Matter Content, Ages and Mass-to-Light Ratios in Spiral Galaxies

研究螺旋星系中暗物质含量、年龄和质量-光比之间的相关性

Arpit Kottur, Meet Mehta, Raka Dabhade

专题命中 仓库级理解 :repository(abstract)

AI总结 研究螺旋星系中暗物质含量、年龄和质量-光比的相关性,揭示了银河年龄与暗物质积累的强正相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04190 2025-12-02 cs.CV 50%

Computer Vision for Clinical Gait Analysis: A Gait Abnormality Video Dataset

用于临床步态分析的计算机视觉:一个步态异常视频数据集

Rahm Ranjan, David Ahmedt-Aristizabal, Mohammad Ali Armin, Juno Kim

机构 * Imaging and Computer Vision Group, CSIRO Data61(CSIRO Data61影像与计算机视觉组) University of New South Wales(新南威尔士大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出GAVD数据集,用于临床步态分析,包含大量视频数据和临床标注,通过预训练模型实现步态异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00001 2025-12-02 cs.DL 50%

Identifying and extracting Data Access Statements from full-text academic articles

从全文学术文章中识别和提取数据访问声明

David Pride, Matteo Cancellieri, Petr Knoth

专题命中 仓库级理解 :repository(abstract)

AI总结 CORE开发机器学习工具,自动从学术文章中识别和提取数据访问声明,以提高元数据质量和数据共享效率。

Comments Presented at the Open Repositories Conference 2025, Chicago, Illinois

详情

展开后加载摘要…

URL PDF HTML 收藏