arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-26 至 2026-08-26 共收录 8 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 8 篇

2608.23653 2026-08-26 cs.SE cs.AI 新提交 73%

Beyond Executable Models: The Pufibara Agent Harness and the Modelica Agent Workflow Benchmark for Physical System Modeling

超越可执行模型:用于物理系统建模的Pufibara智能体框架与Modelica智能体工作流基准

Zizhe Wang

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对物理系统建模中智能体的状态管理与证据关联问题,提出Pufibara智能体框架,并构建含232个任务的基准,实验显示其在任务成功率与资源效率上优于Claude Code。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24086 2026-08-26 cs.AI cs.CE cs.SE 新提交 62%

EMRB: A Multi-Level Benchmark for Evaluating LLM Reasoning over Raw Electromagnetic Signals

EMRB:用于评估大型语言模型对原始电磁信号推理能力的多级基准

Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang, Shan Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The 63rd Research Institute, National University of Defense Technology(国防科技大学第六十三研究所) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出EMRB基准评估LLMs对原始电磁信号的推理能力,针对14个LLMs的实验显示其表现存在差距,提出的ReconPilot方法可显著提升LLMs的相关任务得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23918 2026-08-26 cs.AI cs.MA cs.PL 新提交 62%

MARS: Multi-Specialist LLM Relay System for Competitive Programming

MARS:用于竞赛编程的多专家大语言模型中继系统

Andrei Mikhailov, Mikhail Burtsev, Alsu Sagirova

机构 * MIRAI London Institute for Mathematical Sciences(伦敦数学科学研究院) AXXX

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 MARS是用于竞赛编程的多专家LLM中继框架,通过检索选择算法领域专家组成流水线,在CodeContests测试集上以更低成本和方差达到0.624±0.006的通过率,缩小了与CodeSIM的差距。

Comments 13 pages, 8 figures, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23632 2026-08-26 cs.AI cs.SE 新提交 62%

Function-Level Execution Feedback for Code Preference Optimization

用于代码偏好优化的函数级执行反馈

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。

Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29717 2026-08-26 cond-mat.mtrl-sci cs.AI cs.LG 版本更新 62%

Optimizing Expert-Designed Crystal Graph Networks for Band-Gap Prediction with an Autonomous LLM Research Loop

利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测

Chenmu Zhang, Boris I. Yakobson

机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16497 2026-08-26 cs.LG cs.AI 版本更新 62%

msData: A Millisecond-Resolution Network Dataset for Advancing Time Series Foundation Models

弥合高频数据缺口:一种毫秒级分辨率的网络数据集以推进时间序列基础模型

Subina Khanal, Seshu Tirupathi, Merim Dzaferagic, Marco Ruffini, Torben Bach Pedersen

机构 * Department of Computer Science, Aalborg University, Aalborg, Denmark(奥尔堡大学计算机科学系) IBM Research Europe, Dublin, Ireland(IBM欧洲研究院) Trinity College Dublin, The University of Dublin, Dublin, Ireland(都柏林大学三一学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个毫秒级分辨率的数据集,用于提升时间序列基础模型对高频数据的处理能力,并展示传统模型在该数据集上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-08-26 cs.CV cs.AI cs.CL 版本更新 62%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24439 2026-08-26 cs.CV 新提交 50%

DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton

DoublesEval:通过专业双打羽毛球诊断视觉语言模型的多智能体战术推理能力

Jintao Cheng, Weibin Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学)

专题命中 代码评测 :repository(abstract)

AI总结 本研究提出DoublesEval框架,以专业双打羽毛球为测试平台评估VLMs的多智能体战术推理能力,发现现有模型存在明显瓶颈,所提TacticCheck可提升模型表现但仍有差距,强调需改进VLMs的评估范式。

Comments Accepted by BMVC2026

详情

展开后加载摘要…

URL PDF HTML 收藏