arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-25 至 2026-08-25 共收录 7 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 7 篇

2606.11864 2026-08-25 cs.IR 版本更新 67%

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

CORE-Bench:智能体编程时代代码检索的综合基准

Fuwei Zhang, Yanzhao Zhang, Mingxin Li, Dingkun Long, Lexiang Hu, Pengjun Xie, Zhao Zhang, Fuzhen Zhuang

专题命中 代码评测 :repository(abstract);coding agent(abstract)

AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。

Comments Accepted By EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04448 2026-08-25 cs.AI cs.CL cs.CV cs.LG cs.MA 版本更新 67%

SkillNet: Create, Evaluate, and Connect AI Skills

SkillNet: 创建、评估和连接AI技能

Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Yida Xue, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tongji University(同济大学) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) Tencent(腾讯) Fudan University(复旦大学) The University of Edinburgh(爱丁堡大学) Monash University(墨尔本大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huzhou University(湖州大学) Hornor Device Co., Ltd(Hornor设备有限公司) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。

Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12295 2026-08-25 cs.CL cs.AI cs.LG 版本更新 67%

Text-ADBench: Text Anomaly Detection Benchmark Based on LLM Embeddings

Text-ADBench:基于大语言模型嵌入的文本异常检测基准

Feng Xiao, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了基于LLM嵌入的文本异常检测基准,通过多模型、多数据集的实验发现嵌入质量决定检测效果,深度学习方法在LLM嵌入下无性能优势,还提出了高效评估策略并开源工具包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21558 2026-08-25 cs.CL cs.AI 新提交 62%

Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation

通过TRIAD实现多跳RAG评估自动化:从上下文提取到验证数据集生成

Lorenz Brehme, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TRIAD三阶段自动化多跳RAG评估数据集生成方法,经与MuSiQue、HotpotQA对比验证,该生成数据集可有效评估特定领域RAG系统性能,相关代码与验证结果已公开。

Comments Accepted at the 19th International Natural Language Generation Conference (INLG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21398 2026-08-25 cs.LG cs.AI cs.CY cs.HC cs.MA 新提交 62%

Runtime Action Interference for AI Control of AlphaStar in StarCraft II

星际争霸II中AlphaStar的AI控制之运行时动作干预

Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao

机构 * University of New South Wales(新南威尔士大学) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出运行时动作干预(RAI)机制,将其应用于AlphaStar复现版并开展《星际争霸II》人类实验,发现向用户披露AI对手能力会显著影响人类对其公平性、毒性的感知,需将执行栈控制与能力披露分开评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18646 2026-08-25 cs.AI cs.CL 版本更新 62%

Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap

超越基准:基于拟人化与生命周期导向路线图的大语言模型评估

Jun Wang, Ninglun Gu, Kailai Zhang, Pengyong Li, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Zijiao Zhang, Yihuan Liu, Gary G. Yen, Junchi Yan

机构 * Department of Networks, China Mobile Communications Group Co.,Ltd.(中国移动通信集团有限公司网络部) Xidian University(西安电子科技大学) Oklahoma State University(俄克拉荷马州立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM基准分数与实际效用脱节问题,建立诊断本体并提出含IQ、PQ、EQ、VQ的拟人化评估框架,分析200余个基准后为LLM开发提供战略指引。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17136 2026-08-25 quant-ph cs.ET 版本更新 50%

Gate-level Implementation and Resource Analysis of Lackadaisical Quantum Walk Search

懒散量子行走搜索的门级实现与资源分析

Amit Saha, Debanjan Kola, Nishanka Das, Amlan Chakrabarti

专题命中 代码评测 :code model(abstract)

AI总结 本文提出懒散量子行走搜索的门级实现框架,验证其搜索性能并分析资源开销,为量子硬件上的懒散量子行走搜索提供实用实现方案及容错资源评估。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏