arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 124 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 124 篇

2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 62%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06796 2026-07-09 cs.LG cs.AI 新提交 62%

Enhancing deep learning models for time series classification via knowledge distillation

通过知识蒸馏增强用于时间序列分类的深度学习模型

Javidan Abdullayev, Maxime Devanne, Jonathan Weber, Germain Forestier

机构 * IRIMAS, University of Haute Alsace(IRIMAS,法国高等教育高级阿列省大学) Faculty of IT, Monash University(信息技术学院,莫纳什大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究知识蒸馏用于时间序列分类的有效性,在FCN、Inception和ConvTran三种架构上评估,修改组件后在UCR Archive数据集测试,发现对中等复杂度学生模型效果最佳,不同模型经蒸馏有不同程度参数减少和性能提升,并提供实现代码。

Comments Published version. Open access under CC BY 4.0. 24 pages, 11 figures

Journal ref Knowledge and Information Systems, Volume 68, Article 215, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06505 2026-07-08 cs.SE cs.AI cs.DB 新提交 62%

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

使用北美行业分类系统(NAICS)对GitHub仓库进行行业分类

Kevin Xu, Alexander Quispe

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究利用北美行业分类系统对GitHub仓库进行行业分类,提出结合多种技术的检索与验证管道生成标签,构建NAICS-GH语料库,测试表明标签精度高,还对预训练编码器进行基准测试,相关数据和代码开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06125 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries

评估Dart AOT二进制文件神经反编译的微调与指标

Raafat Abualazm, Ayman AboElhassan, Amr G. Wassal

机构 * Cairo University Computer Engineering Department, Faculty of Engineering(开罗大学计算机工程系,工程学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究针对Dart AOT二进制文件神经反编译,在新基准上用三个指标评估六种微调模型变体,发现无微调配置能显著提升pass@k,存在跨语言干扰及指标差异,指出汇编序列长度是任务难度关键预测指标,贡献新基准等并明确pass@k为主要评估指标。

Comments Under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 62%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05443 2026-07-08 cs.IR cs.AI cs.SE 新提交 62%

Scientific Code Search at Scale: A Multi-Domain Dataset and Benchmark

大规模科学代码搜索:多领域数据集与基准测试

Nishan Pantha, Pranath Reddy Kumbam, Sajil Awale, Pushwitha Krishnappa, Muthukumaran Ramasubramanian, Nidhi Jha, Emily Foshee, Ankur Kumar, Rachel Slank, Ashkbiz Danehkar, Rahul Ramachandran

机构 * The University of Alabama in Huntsville (UAH)(阿拉巴马大学亨茨维尔分校) Universities Space Research Association (USRA)(大学空间研究协会) NASA Marshall Space Flight Center(美国国家航空航天局马歇尔太空飞行中心)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对科学家在众多GitHub库中找相关软件难的问题,构建含多领域科学存储库的语料库,引入存储库搜索及代码片段检索两个基准测试,揭示不同领域性能差异,相关数据集和基准已公开,助力科学工具发现研究。

Comments Datasets and benchmarks publicly released on HuggingFace. Code released on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14948 2026-07-08 cs.SE cs.AI 新提交 62%

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力

Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Milad Soltany, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算科学学院)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04912 2026-07-07 cs.CV cs.AI cs.LG 新提交 62%

Graph Representation Learning of Longitudinal Medical Imaging Trajectories for Treatment Response Prediction

用于治疗反应预测的纵向医学影像轨迹的图表示学习

Johannes Kiechle, Richard Osuala, Daniel M. Lang, Stefan M. Fischer, Ivana Janíčková, Karim Lekadir, Julia A. Schnabel, Jan C. Peeken

机构 * Technical University of Munich(慕尼黑工业大学) TUM University Hospital Rechts der Isar(慕尼黑工业大学伊萨尔河右岸大学医院) Helmholtz Munich(慕尼黑亥姆霍兹中心) Universitat de Barcelona(巴塞罗那大学) Medical University of Vienna(维也纳医科大学) King’s College London(伦敦国王学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 针对乳腺癌患者新辅助化疗治疗反应预测难题,提出基于影像的3D时空框架,集成图神经网络及时空交互关系建模与新自监督目标,实验表明该方法性能优越,还建立了预测基准并评估相关影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交 62%

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交 62%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 62%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 代码评测 :code model(abstract);分类 cs.CL、cs.AI

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27679 2026-06-29 cs.CL cs.AI 新提交 62%

From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity KAIST(韩国科学技术院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26859 2026-06-29 cs.AI cs.CL cs.IR 新提交 62%

AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems

AgentX:迈向智能体驱动的工业推荐系统自迭代

Changxin Lao, Fei Pan, Guozhuang Ma, Han Li, Huihuang Lin, Jijun Shi, Kangzhi Zhao, Kun Gai, Mo Zhou, Qinqin Zhou, Quan Chen, Ruochen Yang, Shifu Bie, Shijie Yi, Shuang Yang, Shuo Yang, Wenhao Li, Wentao Xie, Xiao Lv, Xuming Wang, Yijun Wang, Yiming Chen, Yusheng Huang, Zhongyuan Wang, Zibo Zhao, Zijie Zhuang, Baoning Xia, Chao Liu, Chaoyi Ma, Chubo He, Dawei Cong, Feng Jiang, Gang Wang, Guilin Xia, Hanwen Xu, Jiahong Xie, Jiahui Qiao, Jian Liang, Jiangfan Yue, Jing Wang, Jinghan Yang, Jinghui Jia, Kan Qin, Lei Wang, Ming Li, Peilin Song, Pengbo Xu, Qiang Luo, Ruiming Tang, Shiyang Liu, Shuxian Jin, Tao Wang, Tao Zhang, Xiang Gao, Xianghan Li, Yingsong Luo, Yiwen Ning, Yongcheng Liu, Yueyang Liu, Yuan Guo, Zhaojie Liu, Zhenkai Cui

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 提出AgentX多智能体系统,通过闭环迭代自动生成、实施、评估推荐实验,实现工业推荐系统的自进化,突破人工瓶颈。

Comments Authors are listed alphabetically by their first name

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26852 2026-06-26 cs.AI cs.SE 新提交 62%

Context-Aware Synthesis of Optimization Pipelines for Warehouse Optimization

面向仓库优化的上下文感知优化流水线合成

Janik Bischoff, Anne Meyer, Uta Mohring, Fabian Dunke, Maximilian Barlang, Özge Nur Subas, Hadi Kutabi, Stefan Nickel, Kai Furmans

机构 * Institute for Information Management in Engineering, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院信息管理工程研究所) Department of Business Administration, University of Zurich(苏黎世大学工商管理系) Institute for Operations Research, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院运筹学研究所)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出CASOP框架,通过模块化算法库、语义卡片、问题分类、流水线合成与评估,自动生成并评估针对特定仓库上下文的优化流水线,在7个基准集上验证了1063044条有效流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22906 2026-06-23 cs.SE cs.AI 新提交 62%

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

从片段到路径:大型工业代码库的任务级上下文恢复

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

机构 * AMAP, Alibaba Group(阿里集团AMAP) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) University of Cambridge(剑桥大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。

Comments 12 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 62%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16988 2026-06-16 cs.SE cs.LG 新提交 62%

Agent trajectories as programs: fingerprinting and programming coding-agent behavior

智能体轨迹作为程序:编码智能体行为的指纹识别与编程

Hamidah Oderinwale

机构 * McGill University(麦吉尔大学) Taste Labs

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.LG

AI总结 提出通过程序性表示分析智能体行为模式,实现轨迹指纹识别(85.7%准确率),并开发ProcGrep库用于审计和评估智能体任务处理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13608 2026-06-16 cs.AI cs.LG 新提交 62%

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12608 2026-06-12 cs.CL cs.LG 新提交 62%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09800 2026-06-09 cs.SE cs.AI cs.MA 新提交 62%

FASE: Fast Adaptive Semantic Entropy for Code Quality

FASE: 用于代码质量的快速自适应语义熵

Shizhe Lin, Ladan Tahvildari

机构 * University of Waterloo(滑铁卢大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08840 2026-06-09 cs.AI cs.SE 新提交 62%

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

超越通过率:开放代码大语言模型的多语言、执行基础评估

Sayed Erfan Arefin

机构 * Sayed Erfan Arefin

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 针对12种编程语言的2707道LeetCode问题,评估9个开放代码LLM,发现最佳模型Yi-Coder-9B-Chat的正确率仅23.64%,远低于人类57.2%的基准,且排名因问题难度和语言而异,编译错误占失败原因的63.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14560 2026-08-18 cs.DC cs.SE 新提交 61%

Agentic Kernel Optimization: Generating State-of-the-Art GPU Kernels Without Hand-Written CUDA

智能体内核优化:无需手动编写CUDA即可生成最先进的GPU内核

Mao Luo, Hongbin Li, Feng Lin, Hanling Yi, Zhe Huang

专题命中 代码评测 :coding agent(abstract);分类 cs.SE;code generation(comments)

AI总结 该研究构建多智能体编排框架Houmao的GPU内核优化工作流,利用通用代码智能体在无需手动CUDA代码的情况下,生成的GPU内核在多个任务上实现远超PyTorch和FlashInfer基线的加速,在竞赛中取得最优结果,证明代码智能体可作为GPU内核开发的有效自主优化器。

Comments Technical report on AI code generation for practical GPU kernels on NVIDIA Blackwell GPUs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06413 2026-07-08 stat.ME cs.AI 新提交 61%

An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery

一种评估智能体人工智能自主模型发现的实验设计方法

Hao He, Xueying Liu, Chris J. Kuhlman, Xinwei Deng

机构 * Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院) Department of Statistical Science, Baylor University(统计科学系,贝勒大学) Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI;repository(comments)

AI总结 研究大型语言模型编码智能体自主模型发现行为,提出实验设计与分析框架,将智能体视为随机模型发现算子,在多种受控因素下研究Codex和Claude Code两个算子,进行回归模型和推理,开发规范分解,通过网络造词游戏测试平台得出相关深刻发现。

Comments 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19625 2026-08-21 cs.AI 新提交 57%

Scientific Data Skills: Enabling Agent-Ready Scientific Data Services at Scale

科学数据技能:实现规模化的智能体就绪型科学数据服务

Xiaohan Huang, Qingqing Long, Xiaolei Du, Siyu Pu, Jiawen Xu, Haotian Chen, Chenyang Zhao, Jinbiao Liu, Xuezhi Wang, Hao Wang, Hengshu Zhu, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 针对现有数据集表示难以满足AI智能体需求的问题,提出SciDSK智能体就绪型表示并构建相关平台,可提升智能体的数据集发现与解释能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18588 2026-08-20 cs.SE 新提交 57%

AppEval: A Unified Benchmark for LLM-Based Mobile Application Repair in ArkTS, Swift, and Kotlin

AppEval:面向基于大语言模型的ArkTS、Swift及Kotlin移动应用修复的统一基准

Bang Xie, Hao Liu, Zhenyu Shi, Yonghao Zhang, Senjian Zhang, Zhiyuan Peng, Xin Yin, Chenhao Ying, Yuan Luo, Wei Chen, Haiming Jin, Shaocong Long, Xu Liu, Zhe Peng

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本研究提出AppEval基准框架,评估基于大语言模型的移动应用修复智能体在ArkTS、Swift、Kotlin平台的表现,发现其性能因智能体而异,且运行时感知的接受标准对有意义的比较至关重要。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18242 2026-08-20 cs.LG 新提交 57%

ClosureBench: A Constructive Benchmark for Compositional Graph Reasoning

ClosureBench:面向组合图推理的构造式基准

Stefano Goria

机构 * AIM Research Lab(AIM研究实验室)

专题命中 代码评测 :program synthesis(abstract);分类 cs.LG

AI总结 本研究推出ClosureBench基准,评估不同规模模型在组合图推理任务的表现,发现模型存在记忆效应、组合推理瓶颈,微调输出程序的模型可提升性能。

Comments 30 pages, 5 figures, 11 tables. Code and data: https://github.com/egolabs-ai/closurebench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17524 2026-08-19 cs.LG 新提交 57%

Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents

通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法

Ram Rachum, Yotam Amitai, Bálint Gyevnár, Reuth Mirsky, Cameron Allen

机构 * University of California, Berkeley(加州大学伯克利分校) Tufts University(塔夫茨大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.LG

AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。

Journal ref Proceedings of the Workshop on Explainable Artificial Intelligence (XAI) at IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16638 2026-08-18 cs.SE 新提交 57%

ModBench: A Pipeline for Building Modelica Benchmark Datasets Mined from Library Repositories

ModBench:用于构建从库仓库挖掘的Modelica基准数据集的流水线

Masoud Sadrnezhaad, Martin Sjölund, Adrian Pop, José Antonio Hernández López, Torvald Mårtensson, Dániel Varró

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 ModBench是用于构建Modelica基准数据集的流水线,经其处理Modelica标准库得到含85562个类快照的公开数据集,可支持模型演化分析等相关研究。

Comments Extended abstract accepted at SAM 2026, co-located with MODELS 2026. To appear in the ACM/IEEE MODELS 2026 Companion Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15931 2026-08-18 cs.CL 新提交 57%

PLSQLBench: Benchmarking LLM Systems for Executable Procedural Database Programming

PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试

Marianne Menglin Liu, Leonid Boytsov, Daniel W. Peterson, Pramuditha Perera, Rongguang Wang, Sai Ashish Somayajula, Syed Hamza Rafique, Rohit Saini, Shubham Pathak, Sujeeth Bharadwaj, Tao Sheng, Graham Horwood, Fahad Shah, Ankan Bansal, Sujith Ravi, Dan Roth

机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15250 2026-08-18 cs.SE 新提交 57%

Comparing Domain-Model Similarity Metrics Against Human Expert Ratings

对比领域模型相似度指标与人类专家评分

Vasiliy Seibert

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文实现5种领域模型相似度指标,对比其与39组领域模型的人类专家评分,发现无单一指标在所有标准占优,集成多指标或可替代人类专家评分。

详情

展开后加载摘要…

URL PDF HTML 收藏