arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1740 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1740 篇

2604.00550 2026-04-02 cs.AI 57%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00079 2026-04-02 cs.CR cs.SE 57%

When Labels Are Scarce: A Systematic Mapping of Label-Efficient Code Vulnerability Detection

当标签稀缺时:一种系统性地映射标签高效代码漏洞检测方法

Noor Khalal, Chakib Fettal, Lazhar Labiod, Mohamed Nadif

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 本文系统性地映射了减少对人工标签依赖的代码漏洞检测方法,综合了五种范式家族及其机制,并提出了设计图和约束优先决策指南以指导实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26971 2026-03-31 stat.AP cs.LG 57%

Graph Attention Network-Based Detection of Autism Spectrum Disorder

基于图注意力网络的自闭症谱系障碍检测

Abigail Kelly, Ramchandra Rimal, Arpan Sainju

机构 * Middle Tennessee State University(中田纳西州立大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出一种基于图注意力网络的检测方法,利用fMRI数据构建功能连接矩阵,通过注意力机制识别关键连接模式,提升诊断准确性,实验结果显示在测试数据上达到88.79%的平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24359 2026-03-26 cs.SE cs.HC 57%

Gendered Prompting and LLM Code Review: How Gender Cues in the Prompt Shape Code Quality and Evaluation

性别化提示与大语言模型代码审查:提示中的性别线索如何影响代码质量和评估

Lynn Janzen, Üveys Eroglu, Dorothea Kolossa, Pia Knöferle, Sebastian Möller, Vera Schmitt, Veronika Solopova

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 研究探讨性别化提示对代码生成和审查的影响,发现性别线索在代码质量上影响有限,但对代码审查存在系统性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24051 2026-03-26 cs.CL 57%

FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval

FinToolSyn: 一种用于金融工具使用对话数据的前向合成框架,具有动态工具检索

Caishuang Huang, Yang Qiao, Rongyu Zhang, Junjie Ye, Pu Lu, Wenxi Wu, Meng Zhou, Xiku Du, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) FiT, Tencent(腾讯FiT) Zhejiang University(浙江大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出FinToolSyn框架,通过动态工具检索生成高质量金融对话数据,构建43,066个工具库并合成148k对话实例,提升金融场景下的工具调用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12739 2026-03-24 cs.CL 57%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20352 2026-03-24 cs.LG 57%

The Multiverse of Time Series Machine Learning: an Archive for Multivariate Time Series Classification

时间序列机器学习的多元宇宙:一个用于多变量时间序列分类的档案

Matthew Middlehurst, Aiden Rushbrooke, Ali Ismail-Fawaz, Maxime Devanne, Germain Forestier, Angus Dempster, Geoffrey I. Webb, Christopher Holder, Anthony Bagnall

机构 * University of Bradford(布拉德福德大学) University of East Anglia(东安格利亚大学) Université de Haute-Alsace(阿尔萨斯大学) Monash University(莫纳什大学) University of Southampton(南安普顿大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文扩展了UEA档案,增加至133个分类问题,并发布预处理数据集,更名为Multiverse档案以反映多样性。提供指导和基准评估,建立未来研究的性能标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18173 2026-03-20 cs.CL 57%

GRAFITE: Generative Regression Analysis Framework for Issue Tracking and Evaluation

GRAFITE:用于问题跟踪和评估的生成回归分析框架

Ja Young Lee, Mírian Silva, Mohamed Nasr, Shonda Witherspoon, Enzo Bozzani, Veronique Demers, Radha Ratnaparkhi, Hui Wu, Sara Rosenthal

机构 * IBM Research - AI(IBM人工智能研究院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 GRAFITE通过持续评估平台追踪和评估模型问题,利用LLM作为裁判进行质量测试,支持多模型对比和回归检测。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11808 2026-03-18 cs.AI 57%

Automating Skill Acquisition through Large-Scale Mining of Open-Source Agentic Repositories: A Framework for Multi-Agent Procedural Knowledge Extraction

通过大规模开源代理仓库挖掘实现技能自动化获取:一种多代理过程知识提取框架

Shuzhen Bi, Mengsong Wu, Hao Hao, Keqian Li, Wentao Liu, Siyu Song, Hongbo Zhao, Aimin Zhou

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出一种多代理过程知识提取框架,通过挖掘开源仓库获取高质量代理技能,结合安全治理和评估指标实现可扩展的知识获取,提升知识转移效率40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15112 2026-03-13 cs.AI 57%

ResearchGym: Evaluating Language Model Agents on Real-World AI Research

ResearchGym: 在真实世界人工智能研究中评估语言模型代理

Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。

Comments ICLR 2026 Agents in the Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 57%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07405 2026-03-10 cs.CL cs.CY 57%

SPOT: An Annotated French Corpus and Benchmark for Detecting Critical Interventions in Online Conversations

SPOT:一个标注的法语语料库和基准,用于检测在线对话中的关键干预

Manon Berriche, Célia Nouri, Chloée Clavel, Jean-Philippe Cointet

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 SPOT通过标注法语语料库和基准,检测在线对话中的关键干预,验证了监督学习在非英语社交媒体任务中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10416 2026-03-10 cs.CV cs.AI 57%

Beyond Endpoints: Path-Centric Reasoning for Vectorized Off-Road Network Extraction

超越端点:面向向量化的非公路网络提取的路径中心推理

Wenfei Guan, Jilin Mei, Tong Shen, Xumin Wu, Shuo Wang, Chen Min, Yu Hu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出MaGRoad,一种基于路径中心的非公路道路网络提取方法,通过构建大规模数据集和改进模型结构,在野外环境中实现了更鲁棒的道路提取。

Comments This revision improves clarity and consistency throughout the paper. We refine terminology to more precisely describe the vertex extraction optimization, add motivational context to the edge feature encoding section, and clarify the overall inference pipeline. We also add an Acknowledgments section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07148 2026-03-10 cs.LG 57%

Agentic Planning with Reasoning for Image Styling via Offline RL

基于推理的图像风格化代理规划 via 离线强化学习

Subhojyoti Mukherjee, Stefano Petrangeli, Branislav Kveton, Trung Bui, Franck Dernoncourt, Arko Mukherjee

机构 * Adobe Research(Adobe研究)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。

Comments 85 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07091 2026-03-10 cs.SE 57%

Exploring the Reasoning Depth of Small Language Models in Software Architecture: A Multidimensional Evaluation Framework Towards Software Engineering 2.0

探索小型语言模型在软件架构中的推理深度:一项面向软件工程2.0的多维评估框架

Ha Vo, Nhut Tran, Khang Vo, Phat T. Tran-Truong, Son Ha

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究通过多维评估框架评估小型语言模型在软件架构中的推理深度,发现参数阈值影响推理能力,揭示了中等大小模型在短上下文下的校准机制及语义多样性与幻觉的相关性。

Comments Accepted at ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10452 2026-03-09 cs.SE 57%

UniCoR: Modality Collaboration for Robust Cross-Language Hybrid Code Retrieval

UniCoR: 代码多模态协作以实现稳健的跨语言混合代码检索

Yang Yang, Li Kuang, Jiakun Liu, Zhongxin Liu, Yingjie Xia, David Lo

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 UniCoR通过多模态协作和自监督学习提升跨语言混合代码检索的语义理解和泛化能力。

Comments Accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06541 2026-03-09 cs.DB cs.AI cs.MA 57%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04304 2026-03-05 cs.CL 57%

$V_1$: Unifying Generation and Self-Verification for Parallel Reasoners

$V_1$: 为并行推理器统一生成与自我验证

Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan, Xiaoxia Wu, Junxiong Wang, Alpay Ariyak, Qingyang Wu, Samir Khaki, Rishabh Tiwari, Long Lian, Yucheng Lu, Boyi Li, Alane Suhr, Ben Athiwaratkun, Kurt Keutzer

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 $V_1$通过高效成对排名统一生成与自我验证,提升代码生成和数学推理任务的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03233 2026-03-04 cs.AI 57%

AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework

面向科学的AI低代码平台与贝叶斯对抗多智能体框架

Zihang Zeng, Jiaquan Zhang, Pengze Li, Yuan Qi, Xi Chen

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究提出一种面向科学的AI低代码平台,通过贝叶斯对抗多智能体框架实现代码生成与评估的协同优化,提升科学任务的可靠性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02176 2026-03-03 cs.CL 57%

Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale

在生态系统层面组织、协调和基准测试代理技能

Hao Li, Chunjiang Mu, Jianhao Chen, Siyue Ren, Zhiyao Cui, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出AgentSkillOS框架,通过树状检索和DAG协调提升大规模技能生态系统的管理和任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01051 2026-03-03 hep-ex cs.SE 57%

CelloAI Benchmarks: Toward Repeatable Evaluation of AI Assistants

CelloAI Benchmarks: 向AI助手评估的可重复性迈进

Mohammad Atif, Kriti Chopra, Fang-Ying Tsai, Ozgur O. Kilic, Tianle Wang, Zhihua Dong, Douglas Benjamin, Charles Leggett, Meifeng Lin, Paolo Calafiura, Salman Habib

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CelloAI Benchmarks提出了一套针对高能物理和高性能计算领域AI助手的可重复性评估基准,涵盖代码文档、代码生成和图形数据分析三个评估赛道,旨在提升科学编码辅助的可靠性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15018 2026-03-03 cs.CV cs.AI cs.RO 57%

UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos

UrbanVerse: 通过观看城市游览视频扩大城市模拟

Mingxuan Liu, Honglin He, Elisa Ricci, Wayne Wu, Bolei Zhou

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 UrbanVerse 通过将众包城市游览视频转化为物理-aware 的模拟场景,实现了城市模拟的扩展,提升了城市导航中代理的泛化能力和现实任务完成效率。

Comments Accepted to ICLR 2026. Project page: https://urbanverseproject.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01350 2026-02-26 cs.AI 57%

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

通过视觉-语言模型实现无训练的3DCAD装配体部件检索:基于错误笔记本的引导

Yunqing Liu, Nan Zhang, Zhiming Tan

机构 * Fujitsu Research & Development Center Shanghai, China(富士通研发中心上海)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本研究提出一种无训练的3D CAD部件检索方法,通过结合错误笔记本与RAG技术,显著提升基于VLM的推理性能,实验显示在专有模型和开源模型上均取得显著效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12434 2026-02-25 cs.AI 57%

A Survey on the Optimization of Large Language Model-based Agents

基于大语言模型代理的优化综述

Shangheng Du, Jiabao Zhao, Jinxin Shi, Zhentao Xie, Xin Jiang, Yanhong Bai, Liang He

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(上海人工智能教育研究院,东华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学) School of Computer Science and Technology, Donghua University(计算机科学与技术学院,东华大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理优化方法,分类讨论参数驱动与参数无关策略,分析关键技术和挑战,提出未来研究方向。

Comments Published in ACM Computing Surveys, Vol. 58, No. 9, Article 223, July 2026

Journal ref ACM Computing Surveys 58(9), Article 223, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20513 2026-02-25 cs.CL 57%

From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility

从性能到目的:一种用于评估大语言模型效用的社技术分类

Gavin Levinson, Keith Feldman

机构 * University of Michigan(密歇根大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出LUX框架,用于评估大语言模型在不同应用场景中的效用,涵盖性能、交互、运营和治理四个领域,并提供动态工具支持框架探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25609 2026-02-25 cs.AI cs.CY 57%

A Framework for Studying AI Agent Behavior: Evidence from Consumer Choice Experiments

研究AI代理行为的框架:来自消费者选择实验的证据

Manuel Cherep, Chengtian Ma, Abigail Xu, Maya Shaked, Pattie Maes, Nikhil Singh

机构 * MIT(麻省理工学院) Tsinghua University(清华大学) Dartmouth College(达特茅斯学院)

专题命中 代码评测 :software agent(abstract);分类 cs.AI

AI总结 本文提出ABxLab框架,通过控制选项属性和说服性提示,研究AI代理在现实决策中的选择行为,揭示代理在无认知限制下仍存在强烈偏好偏见,为AI代理行为研究提供测试平台。

Comments ICLR, 31 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18095 2026-02-23 cs.AI 57%

Neurosymbolic Language Reasoning as Satisfiability Modulo Theory

神经符号语言推理作为可满足性模理论

Hyunseok Oh, Sam Stern, Youngki Lee, Matthai Philipose

机构 * Seoul National University(首尔国立大学) U. Mass. Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft(微软公司)

专题命中 代码评测 :program synthesis(abstract);分类 cs.AI

AI总结 Logitext通过结合LLM和SMT求解,实现自然语言与逻辑推理的联合处理,提升内容审核和法律任务的准确性和覆盖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17640 2026-02-20 cs.LG eess.SP 57%

A Network Science Approach to Granular Time Series Segmentation

一种基于网络科学的粒度时间序列分割方法

Ivana Kesić, Carolina Fortuna, Mihael Mohorčič, Blaž Bertalanič

机构 * Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出一种基于网络科学的粒度时间序列分割方法,通过将时间序列转换为图并结合图注意力网络,提升分割精度,达到0.97的平均F1分数,并在多个基准数据集上优于基线方法。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19666 2026-02-17 cs.CL 57%

RoD-TAL: A Benchmark for Answering Questions in Romanian Driving License Exams

RoD-TAL:罗马尼亚驾照考试问答的基准测试

Andrei Vlad Man, Răzvan-Alexandru Smădu, Cristian-George Craciun, Dumitru-Clementin Cercel, Florin Pop, Mihaela-Claudia Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest, Faculty of Automatic Control and Computers(波兰技术大学布加勒斯特分校) Technical University of Munich(慕尼黑技术大学) National Institute for Research & Development in Informatics - ICI Bucharest(信息研究所-布加勒斯特) Paris 1 Panthéon-Sorbonne University(巴黎1大学) University of Bucharest(布加勒斯特大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 RoD-TAL是一个用于评估大型语言模型和视觉语言模型在罗马尼亚驾照法律问答中性能的多模态基准数据集,通过文本和图像问答任务验证了领域微调和推理优化对考试通过率的影响。

Comments 41 pages, 30 figures, Accepted by the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏