arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-25 至 2026-08-25 共收录 48 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 7 篇

2608.21558 2026-08-25 cs.CL cs.AI 新提交 62%

Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation

通过TRIAD实现多跳RAG评估自动化:从上下文提取到验证数据集生成

Lorenz Brehme, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TRIAD三阶段自动化多跳RAG评估数据集生成方法,经与MuSiQue、HotpotQA对比验证,该生成数据集可有效评估特定领域RAG系统性能,相关代码与验证结果已公开。

Comments Accepted at the 19th International Natural Language Generation Conference (INLG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21398 2026-08-25 cs.LG cs.AI cs.CY cs.HC cs.MA 新提交 62%

Runtime Action Interference for AI Control of AlphaStar in StarCraft II

星际争霸II中AlphaStar的AI控制之运行时动作干预

Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao

机构 * University of New South Wales(新南威尔士大学) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出运行时动作干预(RAI)机制,将其应用于AlphaStar复现版并开展《星际争霸II》人类实验,发现向用户披露AI对手能力会显著影响人类对其公平性、毒性的感知,需将执行栈控制与能力披露分开评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18646 2026-08-25 cs.AI cs.CL 版本更新 62%

Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap

超越基准:基于拟人化与生命周期导向路线图的大语言模型评估

Jun Wang, Ninglun Gu, Kailai Zhang, Pengyong Li, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Zijiao Zhang, Yihuan Liu, Gary G. Yen, Junchi Yan

机构 * Department of Networks, China Mobile Communications Group Co.,Ltd.(中国移动通信集团有限公司网络部) Xidian University(西安电子科技大学) Oklahoma State University(俄克拉荷马州立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM基准分数与实际效用脱节问题,建立诊断本体并提出含IQ、PQ、EQ、VQ的拟人化评估框架,分析200余个基准后为LLM开发提供战略指引。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17136 2026-08-25 quant-ph cs.ET 版本更新 50%

Gate-level Implementation and Resource Analysis of Lackadaisical Quantum Walk Search

懒散量子行走搜索的门级实现与资源分析

Amit Saha, Debanjan Kola, Nishanka Das, Amlan Chakrabarti

专题命中 代码评测 :code model(abstract)

AI总结 本文提出懒散量子行走搜索的门级实现框架,验证其搜索性能并分析资源开销,为量子硬件上的懒散量子行走搜索提供实用实现方案及容错资源评估。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 仓库级理解 11 篇

2608.21964 2026-08-25 cs.AI cs.SE 新提交 81%

Repo2Skill-Evo: Repository Skills Go Stale in Silence

Repo2Skill-Evo:仓库技能在静默中过时

Chenyuan Duan, Ge Shi, Zineng Mao, Ge Zhang, Hao Liang, Yinzhu Piao, Yuchen Wu, Zhixin Yao, Kaiyu Huang, Wenhao Huang, Linzhuang Sun, Shen Yan, Wentao Zhang

机构 * ByteDance(字节跳动) Peking University(北京大学) Beijing Jiaotong University(北京交通大学)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 Repo2Skill-Evo研究发现,在57个真实仓库的105次版本转换中,前沿智能体难以可靠维护仓库技能,其平均@3 macro F1仅29.9%-69.7%,仓库技能会在无明确信号的情况下静默过时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21794 2026-08-25 cs.CL cs.AI cs.HC 新提交 62%

Lexical Coupling in GUI Element Grounding: Sentence Embeddings Track Labels across Mobile and Web

GUI元素定位中的词汇耦合:句子嵌入追踪移动端与网页的标签

Qijia Chen, Giulio Jacucci

机构 * University of Helsinki(赫尔辛基大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对GUI定位评估中嵌入相似度与语义定位的混淆问题,对比编码器与词汇基线,提出需报告词汇基线等诊断指标以区分标签恢复与语义定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22928 2026-08-25 cs.PL cs.CR 新提交 57%

When Can Agents Safely Checkpoint, Fork, Restore, and Merge? Exact Checking for Execution Edits

智能体何时能安全地进行检查点、分叉、恢复与合并?执行编辑的精确检查

Yusheng Zheng, Xiaoyu Song, Yanpeng Hu, Lebin Cheng, Yuxi Huang, Wei Zhang

专题命中 仓库级理解 :repository(abstract);分类 cs.PL

AI总结 该研究针对智能体的检查点、分叉等执行编辑操作,提出一种精确判定编辑安全性的算法,通过形式化方法验证,相关成果已在 Lean 中实现并开源。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22215 2026-08-25 cs.CL 新提交 57%

Dual-Layer Agentic Memory with Fast Write Routing and Slow Consolidation

带有快速写入路由与慢速整合的双层智能体记忆

Wenzhi Li, Dong Nie, Rui Lan, Tongtong Lyu, Peiyao Wang, Lingzi Hong, Weihang Pan, Boyuan Pan, Yao Hu

机构 * Zhejiang University(浙江大学) Xiaohongshu(小红书) University of North Texas(北得克萨斯大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 该研究针对LLM智能体动态环境下的记忆管理问题,提出双层智能体记忆框架,通过成本感知路由与周期性整合实现高效记忆处理,在保留高检索性能的同时减少冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22045 2026-08-25 cs.HC cs.AI 新提交 57%

Multi-Agent Discovery and Resource-Aware Autonomous Exploration of Scientific Datasets

科学数据集的多智能体发现与资源感知自主探索

Aashish Panta, Hugo Lee, Giorgio Scorzelli, Kyongsik Yun, Valerio Pascucci

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 针对单个研究者难以发现探索大规模科学数据集的问题,提出WebVisus多智能体系统,可基于自然语言问题启动自主智能体,适配资源探索数据集并完成案例验证。

Comments 10 pages, 4 figures, 1 table. To appear in 2026 IEEE eScience Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-25 cs.SE 新提交 57%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09716 2026-08-25 cs.CL 版本更新 57%

Opportunities and Challenges of Natural Language Processing for Low-Resource Senegalese Languages in Social Science Research

自然语言处理在塞内加尔语言社会科学研究中的机遇与挑战

Derguene Mbaye, Tatiana D. P. Mbengue, Madoune R. Seye, Moussa Diallo, Mamadou L. Ndiaye, Dimitri S. Adjanohoun, Cheikh S. Wade, Djiby Sow, Jean-Claude B. Munyaka, Jerome Chenal

机构 * Polytechnic School (ESP)(多科技术校) Gaston Berger University (UGB)(加斯顿-伯杰大学) Federal Institute of Technology Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文探讨了自然语言处理在塞内加尔六种语言社会科学研究中的机遇与挑战,提出构建可持续的NLP生态系统,强调伦理治理与跨学科合作。

Comments 45 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05813 2026-08-25 cs.SE 版本更新 57%

An Empirical Study of Java Code Improvements Based on Stack Overflow Answer Edits

基于Stack Overflow回答编辑的Java代码改进实证研究

In-on Wiratsin, Chaiyong Ragkhitwetsagul, Matheus Paixao, Denis De Sousa, Pongpop Lapvikai, Peter Haddawy

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究通过分析Stack Overflow的Java回答编辑,识别可改进的开源Java代码,发现近7%的采纳回答有多次修订,近半数编辑代码可应用于开源项目,11个bug修复方案被接受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23320 2026-08-25 cs.RO 新提交 50%

ROS2SmolVLA: Enabling Small Vision-Language-Action Models for Integration into Industrial-Grade Lightweight Robots

ROS2SmolVLA:适用于集成到工业级轻量机器人的小型视觉-语言-动作模型

Nils Mandischer, Noah Böckmann, Ludwig Holl, Lars Mikelsons

机构 * University of Augsburg(奥格斯堡大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本研究将SmolVLA适配于Universal Robots轻量机器人,发布ROS2SmolVLA开源接口,通过UR10e取放任务验证其功能,为工业级轻量机器人提供了本地可计算的小型VLA模型方案。

Comments Accepted at 8th International Conference on Industry of the Future and Smart Manufacturing, Padua & Venice, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19001 2026-08-25 cs.CY 版本更新 50%

Open at the Edge, Captured at the Center: llama.cpp and the Political Economy of Local AI Inference

边缘开放,中心捕获:llama.cpp 与本地 AI 推理的政治经济学

Woohyeuk Lee, Hanlin Li, David Gray Widder

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究以 llama.cpp 为对象,分析本地 AI 推理的政治经济动态,发现本地推理拓宽参与度却将控制权向基础设施相关方转移,呼吁政策关注推理基础设施以维持云外 AI 开放性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05708 2026-08-25 q-bio.QM 版本更新 50%

HuBMAP Data Portal: a resource for multimodal spatial and single-cell data of healthy human tissues

HuBMAP 数据门户:健康人体组织多模态空间和单细胞数据的资源

Morgan L. Turner (1), Thomas C. Smits (1), Tiffany S. Liaw (1), Brendan Honick (2), Bill Shirey (3), Lisa Choy (1), Nikolay Akhmetov (1), Shaokun An (4), David Betancur (2), Dominic Bordelon (2), Karl Burke (3), Ivan Cao-Berg (2), John Conroy (1), Chris Csonka (2), Penny Cuda (5), Sean Donahue (5), Stephen Fisher (6), Derek Furst (3), Ed Hanna (2), Josef Hardi (7), Tabassum Kakar (1), Mark S. Keller (1), Devin Lange (1), Xiang Li (2), Yan Ma (1), Alison McWilliams (2), Austen Money (1), Richard Morgan (3), Eric Moerth (1), Juan Muerto (2), Mark A. Musen (7), Emily Nic (2), Martin J. O'Connor (7), Gesina Phillips (2), Alexander J. Ropelewski (2), Ryan Sablosky (2), Sravani Saripalli (4), Max Sibilla (3), Derek Simmel (2), Alan Simmons (3), Xu Tang (4), Joel Welling (2), Zhou Yuan (3), Martin Hemberg (4), HuBMAP Consortium (8), Matthew Ruffalo (5), Jonathan Silverstein (3), Philip Blood (2), Nils Gehlenborg (1) ((1) Harvard Medical School, Boston, MA 02115, (2) Pittsburgh Supercomputing Center, Carnegie Mellon University, Pittsburgh, PA 15213, (3) University of Pittsburgh, Pittsburgh PA 15260, (4) Gene Lay Institute of immunology and Inflammation, Brigham and Women's Hospital, Harvard Medical School and Massachusetts General Hospital, Boston, MA 02115, (5) Carnegie Mellon University, Pittsburgh, PA 15213, (6) University of Pennsylvania, Philadelphia, PA 19104, (7) Stanford University, Stanford, CA 94305, (8) A list of consortium authors and their affiliations appear at the end of the paper)

专题命中 仓库级理解 :repository(abstract)

AI总结 介绍 HuBMAP 数据门户,一个整合健康人体组织多模态空间和单细胞数据的综合平台,支持搜索、可视化和分析,并通过统一处理流程确保数据可比性。

Comments 41 pages; 8 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序分析与验证 2 篇

2608.21516 2026-08-25 cs.SE cs.PL 新提交 62%

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning

神经形式化验证:智能体的语言无关形式化程序推理

Shuvendu K. Lahiri

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.SE、cs.PL

AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22630 2026-08-25 cs.PL 新提交 57%

VeGo: Direct Deductive Formal Verification of Go Programs for Computer Science Education

VeGo:面向计算机科学教育的Go程序直接演绎形式化验证

Tina Massoudi, Chris Dutchyn

专题命中 程序分析与验证 :coding agent(abstract);分类 cs.PL

AI总结 该研究提出面向计算机科学教育的VeGo系统,可直接验证标准Go程序,整合多种形式化验证技术,对比其他语言论证Go的优势,经教育教材评估并规划了形式并发规约的路线图。

Comments 13 pages + 2 pages of references, 5 code displays, ancillary reference manual for VeGo

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他AI编程 1 篇

2608.22089 2026-08-25 cs.CR cs.AI 新提交 57%

On Predicting Vulnerability Severity Using In-Context Learning: An Industrial Case Study

利用上下文学习预测漏洞严重性:一项工业案例研究

Daniel Rodriguez-Cardenas, David Nader Palacio, Anna Schmedding, Yiyang Lu, Aadil Mallick, Bill Hudson, Chris Gourley, Michael Roytman, Chris Shenefiel, Evgenia Smirni, Denys Poshyvanyk

专题命中 其他AI编程 :code model(abstract);分类 cs.AI

AI总结 本研究通过工业案例,用可本地部署的开源LLM的上下文学习从C/C++代码片段预测CVSS v3.1评分,发现CodeLlama2-7B在轻量输出约束提示下可接近云服务性能,且Big-Vul可作为工业数据代理。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏