arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12194 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1744 篇

2608.17671 2026-08-19 cs.SE cs.AI cs.CR 新提交 62%

Benchmarking Automated Security Patch Backporting: How Far Are We?

自动化安全补丁回移植基准测试:我们还差多远?

Jincheng Yang, Yulong Fu, Chengwei Liu, Lyuye Zhang, Fangyuan Zhang, Bingyang Ren, Yang Liu, Hui Li

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出涵盖多场景的Porting Benchmark基准,评估五类安全补丁回移植工具,发现工具泛化能力差、复杂补丁性能骤降,明确根本原因并指出优化方向。

Comments 13 pages, 3 figures. Accepted at ASE 2026. Artifact: https://doi.org/10.5281/zenodo.21785770

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12926 2026-08-14 cs.LG cs.AI 新提交 62%

H-VAEP and H-xT: Valuing Offensive On-the-Ball Actions in Handball by Estimating Probabilities

H-VAEP与H-xT:通过概率估计评估手球进攻中持球动作的价值

Julius Broermann, Oliver Müller, Michael Döring, Jochen Baumeister

机构 * Paderborn University(帕德博恩大学) SG Flensburg-Handewitt(弗伦斯堡-汉德维特体育俱乐部)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文将足球的xT与VAEP框架适配至手球,开发H-xT与H-VAEP模型,利用手球德甲数据验证其有效性并发布代码,实现了手球球员的合理评估。

Comments 13 pages, 6 figures, 1 table. Accepted at the 13th Workshop on Machine Learning and Data Mining for Sports Analytics (MLSA 2026), co-located with ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07335 2026-08-14 cs.LG cs.AI 版本更新 62%

Aftab: A Comprehensive Benchmark of CNN Encoders and Advanced Value Functions in Parallelized Q-Networks

Aftab:并行Q网络中CNN编码器与高级价值函数的综合基准

Taha Shieenavaz, Shabnam Zareshahraki, Loris Nanni

机构 * University of Padua(帕多瓦大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对并行Q网络,设计评估8种CNN拓扑并集成多种Q学习扩展,提出复合架构Aftab,在Atari-57与Procgen Hard基准上均优于基线,已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11246 2026-08-13 cs.AI cs.LG cs.RO 新提交 62%

Towards the Harness of Embodied Agents

迈向具身智能体的管控

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。

Comments Project page: https://eit-hai.github.io/thea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29717 2026-08-13 cond-mat.mtrl-sci cs.AI cs.LG 版本更新 62%

Optimizing Expert-Designed Crystal Graph Networks for Band-Gap Prediction with an Autonomous LLM Research Loop

利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测

Chenmu Zhang, Boris I. Yakobson

机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06849 2026-08-13 cs.AI cs.CL 版本更新 62%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25589 2026-08-12 cs.CV cs.AI cs.CL 版本更新 62%

Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact

放射学视觉语言模型基准的法证可重复性审计:从预期协议到发布工件

Mateusz Kozłowski

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 对胸部X光视觉语言模型试点进行法证可重复性审计,追踪提示绑定等多方面情况,发现存在图像渲染、数据分割等问题,重建队列改变统计值,撤回原声明并指定机器可验证控制。

Comments Withdrawn by the author. On further review, the archived artifacts underlying this audit are too incomplete to support the reported statistics, and the paper's conclusions do not follow from the available evidence. The work is withdrawn in full; earlier versions should not be cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13201 2026-08-12 cs.CL cs.AI 版本更新 62%

InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

InfiniteScienceGym:一个无界的、程序生成的科学分析基准

Oliver Bentham, Vivek Srikumar

机构 * Kahlert School of Computing(卡勒特计算学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InfiniteScienceGym,通过程序生成科学仓库和可验证问答任务,评估证据推理、回避和工具分析能力,发现现有模型在回答不可答问题上存在显著缺陷。

Comments 31 pages, 5 figures, 8 tables. Accepted to COLM 2026. See https://infinitesciencegym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08709 2026-08-11 cs.AI cs.SE 新提交 62%

AI Evaluation Should Measure Verification Cost, Not Correctness Alone

AI评估应衡量验证成本,而非仅正确性

Viviana Crescitelli, Generoso Immediato, Fabio Persia, Stefania Costantini

机构 * Hitachi, Ltd.(日立制作所) Hitachi Rail(日立铁路)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 该研究指出AI评估仅靠正确性不足,提出需纳入验证成本,定义了验证成本错误,通过代码生成等证据说明高基准准确率可能掩盖高验证成本,主张评估应考虑现实资源约束下的错误可检测性。

Comments 20 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21597 2026-08-11 cs.SE cs.CL cs.IR 版本更新 62%

ATLAS: Agentic Taxonomy of Large-Scale Software Ecosystems

ATLAS: 大规模软件生态系统的智能体分类体系

Junyi Lu, Mengyao Lyu, Jiahui Wu, Lei Yu, Chengwei Liu, Fengjun Zhang, Li Yang, Chun Zuo, Yang Liu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Nankai University(南开大学) Sinosoft Company Limited(中软国际有限公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL

AI总结 提出ATLAS框架,结合LLM全局知识与实际仓库分布,通过智能体协作和自修正循环自动构建软件仓库的层次化分类体系,在54,387个GitHub仓库上评估,分类质量F1达83.13%,优于基线15个百分点。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26937 2026-08-11 cs.CL cs.AI 版本更新 62%

Beyond Questions: Evaluating LLM's Knowledge Expression

超越问题:评估大型语言模型(实际)知道什么

Luca Giordano, Simon Razniewski

机构 * ScaDS.AI Dresden/Leipzig & TU Dresden, Germany(ScaDS.AI 德尔布兰德/莱比锡及德累斯顿技术大学,德国)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 提出开放知识评估新范式,通过开放式提示(如“告诉我关于M.L. King的一切”)评估模型自然表达的知识,并构建BeQu基准测试10,000个实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21140 2026-08-07 cs.SE cs.AI 版本更新 62%

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配

Han Chi, Jiaxin Qi, Yan Cui, Baisheng Lai, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。

Comments 13 pages, 4 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02430 2026-08-03 cs.SE cs.AI 版本更新 62%

WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics

WebCoderBench: 用全面且可解释的评估指标对Web应用生成进行基准测试

Chenxu Liu, Yingjie Fu, Wei Yang, Ying Zhang, Tao Xie

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出WebCoderBench,首个基于真实用户需求的Web应用生成基准,包含1572个真实用户需求及24个细粒度评估指标,结合规则和LLM评估方法,提供可解释的评估结果,实验显示无单一最优模型,为模型优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26656 2026-07-30 cs.CR cs.AI cs.SE 新提交 62%

Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

图作为验证器:用于过程间漏洞检测的智能体强化学习

Yikun Li, Ting Zhang, Jiakun Liu, Jinfeng Jiang, Yuheng Yieh, Yixin Yang, Wen Bin Leow, Yide Yin, Yintong Huo, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对现有漏洞检测孤立处理函数的问题,提出基于CPG的智能体强化学习框架VulAgentRL,通过图验证设计可靠奖励并预热初始化策略,在仓库级划分下的严格指标及多场景中均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07471 2026-07-29 cs.LG cs.AI cs.CR 版本更新 62%

Where to Intervene? Benchmarking Fairness-Aware Learning on Differentially Private Synthetic Tabular Data

在何处进行干预?对差分隐私合成表格数据上的公平感知学习进行基准测试

Vinícius Gabriel Angelozzi, Héber H. Arcolezi

机构 * ÉTS Montréal(蒙特利尔高等商学院) Inria Grenoble(格勒诺布尔计算机科学及自动化研究所)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究在差分隐私合成表格数据上公平干预的效果,以自适应迭代机制为基准,在多数据集、指标及策略下评估,比较四种管道配置,发现仅DP会降效,公平干预可部分恢复公平,后处理方法权衡更优,还开源相关内容以支持研究。

Comments Paper accepted at PETS 2026. Code is available at https://github.com/vinicius-verona/dp-fair-intervention-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17528 2026-07-24 cs.AI cs.AR cs.LG 版本更新 62%

Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows

人工智能代理真的能完成从RTL到GDS的转换吗?基准测试工具交互式EDA工作流程的经验教训

Jinyuan Deng, Zhengrui Chen, Xufeng Wei, Tianyu Xing, Chenyi Wen, Qi Sun, Cheng Zhuo

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨人工智能代理在EDA工作流程中的表现,提出FluxBench进行系统评估,涵盖多种场景并评估多项能力,引入Token ROI指标。结果显示不同代理系统架构性能有差距,特定领域技能不是提升性能的唯一关键,系统设计和基础模型能力也很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06742 2026-07-20 cs.SE cs.AI 版本更新 62%

Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现

Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者,中国) Singapore Management University, Singapore(新加坡管理大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。

Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04489 2026-07-16 cs.LG cs.AI 62%

Hierarchical Scoring for Machine Learning Classifier Error Impact Evaluation

层次评分用于机器学习分类器误差影响评估

Erin Lanus, Daniel Wolodkin, Laura J. Freeman

机构 * National Security Institute, Virginia Tech(维吉尼亚理工大学国家安全研究所) Applied Research Corporation, Virginia Tech(维吉尼亚理工大学应用研究公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出层次评分度量,通过评分树评估分类器误差影响,实现更细粒度的模型性能评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10212 2026-07-14 cs.AI cs.CL 新提交 62%

KGCQual: An Interpretable Framework for Evaluating the Knowledge Graph Construction Quality from Text

KGCQual:一个用于评估从文本构建知识图谱质量的可解释框架

Nipun Misra, Vikranth Udandarao, Aanchal Gupta, Yogender Kumar, Manuj Mukherjee, Raghava Mutharaju

机构 * VIT Vellore(维洛尔理工学院) IIIT-Delhi(德里信息技术学院) Indian Institute of Technology Palakkad(印度理工学院帕拉卡德分校)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对自动构建知识图谱质量评估问题,提出KGCQual框架,通过实体级和关系级评估,衡量提取图谱与理想图谱的接近度,能识别现有指标遗漏问题,为比较构建方法提供可扩展、可解释框架,还通过实验验证了指标有效性。

Comments This paper is under review at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09791 2026-07-14 cs.LG cs.CL 新提交 62%

Gauge dependence and structured-output corruption in sign-branched repetition penalties: measurements across models, inference stacks, and alternative repetition controls

符号分支重复惩罚中的规范依赖性和结构化输出损坏:跨模型、推理堆栈和替代重复控制的测量

Peter Hollows

专题命中 代码评测 :code model(abstract);分类 cs.CL、cs.LG

AI总结 研究符号分支重复惩罚中规范依赖性和结构化输出损坏问题,发现其惩罚定义不明确且损坏输出,将惩罚应用于归一化对数概率可消除这些问题,给出了相关机制、测量及归一化变体。

Comments 8 pages, 2 figures, 4 tables. Code, data, per-stack survey and git genealogy: https://github.com/captainpete/repetition-penalty-gauge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 62%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03238 2026-07-10 cs.LG cs.AI 版本更新 62%

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类

Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan, Matjaz Gams

机构 * First Citizens Bank(第一公民银行) Alma Mater Europaea University(欧洲大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。

Comments 20 pages, 8 figures; includes code, artifacts, and live demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03195 2026-07-09 cs.AI cs.SE 版本更新 62%

Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

Terminus-4B:一个较小的模型能否在智能体执行任务中取代前沿大语言模型?

Spandan Garg, Vikram Nitin, Yufan Huang

机构 * Microsoft USA(微软公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能体终端执行任务中较小模型能否取代前沿大语言模型。提出经监督微调及强化学习训练的Terminus-4B模型,评估发现其能减少主智能体令牌使用量约30%,不影响性能,还缩小与前沿模型差距甚至超越其性能。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06796 2026-07-09 cs.LG cs.AI 新提交 62%

Enhancing deep learning models for time series classification via knowledge distillation

通过知识蒸馏增强用于时间序列分类的深度学习模型

Javidan Abdullayev, Maxime Devanne, Jonathan Weber, Germain Forestier

机构 * IRIMAS, University of Haute Alsace(IRIMAS,法国高等教育高级阿列省大学) Faculty of IT, Monash University(信息技术学院,莫纳什大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究知识蒸馏用于时间序列分类的有效性,在FCN、Inception和ConvTran三种架构上评估,修改组件后在UCR Archive数据集测试,发现对中等复杂度学生模型效果最佳,不同模型经蒸馏有不同程度参数减少和性能提升,并提供实现代码。

Comments Published version. Open access under CC BY 4.0. 24 pages, 11 figures

Journal ref Knowledge and Information Systems, Volume 68, Article 215, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06505 2026-07-08 cs.SE cs.AI cs.DB 新提交 62%

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

使用北美行业分类系统(NAICS)对GitHub仓库进行行业分类

Kevin Xu, Alexander Quispe

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究利用北美行业分类系统对GitHub仓库进行行业分类,提出结合多种技术的检索与验证管道生成标签,构建NAICS-GH语料库,测试表明标签精度高,还对预训练编码器进行基准测试,相关数据和代码开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06125 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries

评估Dart AOT二进制文件神经反编译的微调与指标

Raafat Abualazm, Ayman AboElhassan, Amr G. Wassal

机构 * Cairo University Computer Engineering Department, Faculty of Engineering(开罗大学计算机工程系,工程学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究针对Dart AOT二进制文件神经反编译,在新基准上用三个指标评估六种微调模型变体,发现无微调配置能显著提升pass@k,存在跨语言干扰及指标差异,指出汇编序列长度是任务难度关键预测指标,贡献新基准等并明确pass@k为主要评估指标。

Comments Under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 62%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05443 2026-07-08 cs.IR cs.AI cs.SE 新提交 62%

Scientific Code Search at Scale: A Multi-Domain Dataset and Benchmark

大规模科学代码搜索:多领域数据集与基准测试

Nishan Pantha, Pranath Reddy Kumbam, Sajil Awale, Pushwitha Krishnappa, Muthukumaran Ramasubramanian, Nidhi Jha, Emily Foshee, Ankur Kumar, Rachel Slank, Ashkbiz Danehkar, Rahul Ramachandran

机构 * The University of Alabama in Huntsville (UAH)(阿拉巴马大学亨茨维尔分校) Universities Space Research Association (USRA)(大学空间研究协会) NASA Marshall Space Flight Center(美国国家航空航天局马歇尔太空飞行中心)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对科学家在众多GitHub库中找相关软件难的问题,构建含多领域科学存储库的语料库,引入存储库搜索及代码片段检索两个基准测试,揭示不同领域性能差异,相关数据集和基准已公开,助力科学工具发现研究。

Comments Datasets and benchmarks publicly released on HuggingFace. Code released on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14948 2026-07-08 cs.SE cs.AI 新提交 62%

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力

Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Milad Soltany, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算科学学院)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏