arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12259 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 仓库级理解 3967 篇

2305.18315 2023-05-31 cs.CL cs.AI cs.IR cs.LG 67%

CDJUR-BR -- A Golden Collection of Legal Document from Brazilian Justice with Fine-Grained Named Entities

Antonio Mauricio, Vladia Pinheiro, Vasco Furtado, João Araújo Monteiro Neto, Francisco das Chagas Jucá Bomfim, André Câmara Ferreira da Costa, Raquel Silveira, Nilsiton Aragão

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, in Portuguese language, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12840 2023-03-02 cs.CL cs.AI cs.LG cs.NE 67%

HULAT at SemEval-2023 Task 10: Data augmentation for pre-trained transformers applied to the detection of sexism in social media

Isabel Segura-Bedmar

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The experiments are not reproducible because I did not use a seed for replicability

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12794 2023-02-27 cs.CL cs.AI cs.LG cs.NE 67%

HULAT at SemEval-2023 Task 9: Data augmentation for pre-trained transformers applied to Multilingual Tweet Intimacy Analysis

Isabel Segura-Bedmar

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07951 2022-12-16 cs.SE cs.LG cs.PL 67%

A Data Source Dependency Analysis Framework for Large Scale Data Science Projects

Laurent Boué, Pratap Kunireddy, Pavle Subotić

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.LG、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12228 2022-10-25 cs.CL cs.AI cs.LG 67%

EDUKG: a Heterogeneous Sustainable K-12 Educational Knowledge Graph

Bowen Zhao, Jiuding Sun, Bin Xu, Xingyu Lu, Yuchen Li, Jifan Yu, Minghui Liu, Tingjian Zhang, Qiuyang Chen, Hanming Li, Lei Hou, Juanzi Li

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.06168 2022-09-14 cs.AI cs.LG cs.PL 67%

Borch: A Deep Universal Probabilistic Programming Language

Lewis Belcher, Johan Gudmundsson, Michael Green

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.03075 2021-12-03 cs.CL cs.AI cs.LG 67%

A Survey of Data Augmentation Approaches for NLP

Steven Y. Feng, Varun Gangal, Jason Wei, Sarath Chandar, Soroush Vosoughi, Teruko Mitamura, Eduard Hovy

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2021 Findings. GitHub repo with paper list at https://github.com/styfeng/DataAug4NLP ; Talk at https://www.youtube.com/watch?v=kNBVesKUZCk&ab_channel=StevenFeng ; Podcast at https://www.youtube.com/watch?v=qmqyT_97Poc&ab_channel=GradientFlow and https://thedataexchange.media/data-augmentation-in-natural-language-processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.01024 2021-04-05 cs.LG cs.AI cs.SE 67%

A Comparison of Similarity Based Instance Selection Methods for Cross Project Defect Prediction

Seyedrebvar Hosseini, Burak Turhan

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

Comments The 36th ACM/SIGAPP Symposium on Applied Computing (SAC'21), 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.05909 2020-10-06 cs.CL cs.AI cs.LG 67%

TextAttack: A Framework for Adversarial Attacks, Data Augmentation, and Adversarial Training in NLP

John X. Morris, Eli Lifland, Jin Yong Yoo, Jake Grigsby, Di Jin, Yanjun Qi

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6 pages. More details are shared at https://github.com/QData/TextAttack

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.16831 2020-07-01 cs.SE cs.CL cs.LG 67%

SE3M: A Model for Software Effort Estimation Using Pre-trained Embedding Models

Eliane M. De Bortoli Fávero, Dalcimar Casanova, Andrey Ricardo Pimentel

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.04538 2018-10-11 cs.SE cs.AI cs.CR cs.LG 67%

Secure Deep Learning Engineering: A Software Quality Assurance Perspective

Lei Ma, Felix Juefei-Xu, Minhui Xue, Qiang Hu, Sen Chen, Bo Li, Yang Liu, Jianjun Zhao, Jianxiong Yin, Simon See

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15374 2026-03-05 cs.IR cs.AI cs.CL 66%

Leveraging Large Language Models for Semantic Query Processing in a Scholarly Knowledge Graph

利用大语言模型在学术知识图谱中进行语义查询处理

Runsong Jia, Bowen Zhang, Sergio J. Rodríguez Méndez, Pouya G. Omran

机构 * Australian National University(澳大利亚国立大学)

专题命中 仓库级理解 :repository(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型与学术知识图谱结合,提升语义查询处理的准确性和效率,以改进学术研究中的知识管理与发现。

Comments for the associated repository, see http://w3id.org/kgcp/KGQP

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08322 2025-08-13 cs.SE cs.AI 66%

Context Engineering for Multi-Agent LLM Code Assistants Using Elicit, NotebookLM, ChatGPT, and Claude Code

Muhammad Haseeb

专题命中 仓库级理解 :code generation(abstract,comments);分类 cs.SE、cs.AI

Comments 15 pages, 5 figures, research paper on multi-agent LLM systems for code generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10537 2025-04-15 cs.SD cs.AI cs.LG eess.AS 66%

Reproducible Machine Learning-based Voice Pathology Detection: Introducing the Pitch Difference Feature

Jan Vrba, Jakub Steinbach, Tomáš Jirsa, Laura Verde, Roberta De Fazio, Yuwen Zeng, Kei Ichiji, Lukáš Hájek, Zuzana Sedláková, Zuzana Urbániová, Martin Chovanec, Jan Mareš, Noriyasu Homma

专题命中 仓库级理解 :repository(abstract,comments);分类 cs.AI、cs.LG

Comments Code repository: https://github.com/aailab-uct/Automated-Robust-and-Reproducible-Voice-Pathology-Detection, Supplementary materials: https://doi.org/10.5281/zenodo.14793017

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08921 2024-09-11 cs.AI cs.CL cs.IR 66%

Graph Retrieval-Augmented Generation: A Survey

Boci Peng, Yun Zhu, Yongchao Liu, Xiaohe Bo, Haizhou Shi, Chuntao Hong, Yan Zhang, Siliang Tang

专题命中 仓库级理解 :repository(abstract,comments);分类 cs.CL、cs.AI

Comments Ongoing work. Compared to the first version, several references have been added and a GitHub repository link has been provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21523 2024-08-01 cs.LG cs.AI cs.DB 66%

Tabular Data Augmentation for Machine Learning: Progress and Prospects of Embracing Generative AI

Lingxi Cui, Huan Li, Ke Chen, Lidan Shou, Gang Chen

专题命中 仓库级理解 :repository(abstract,comments);分类 cs.AI、cs.LG

Comments repository maintained at https://github.com/SuDIS-ZJU/awesome-tabular-data-augmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24807 2026-08-26 cs.SE cs.AI 新提交 62%

Automatic Model Card Generation Using an LLM

基于大语言模型的自动模型卡片生成

Tajkia Rahman Toma, Balreet Grewal, Cor-Paul Bezemer

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出基于LLM的MCTidy与MCGenie,前者重组模型卡片为标准化模板,后者从仓库数据直接生成,经48个Hugging Face模型验证,可实现标准化、可扩展的模型卡片文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23611 2026-08-26 cs.SE cs.AI 新提交 62%

REFINE: A Multi-Agent LLM Approach for Evidence-Guided Code Refactoring

REFINE:一种用于证据引导代码重构的多智能体大语言模型方法

Muhammad Waseem, Aakash Ahmad, Pekka Abrahamsson

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究提出多智能体方法REFINE,结合静态分析、LLM等技术生成Java代码重构候选,在450个文件上使异味降低超68%,效果优于直接提示基线,但存在残留风险需人工审查。

Comments Preprint. 450 Java files from 15 open-source systems; 1,350 model-pass outputs across three LLM configurations. The accompanying replication package will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21794 2026-08-25 cs.CL cs.AI cs.HC 新提交 62%

Lexical Coupling in GUI Element Grounding: Sentence Embeddings Track Labels across Mobile and Web

GUI元素定位中的词汇耦合:句子嵌入追踪移动端与网页的标签

Qijia Chen, Giulio Jacucci

机构 * University of Helsinki(赫尔辛基大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对GUI定位评估中嵌入相似度与语义定位的混淆问题,对比编码器与词汇基线,提出需报告词汇基线等诊断指标以区分标签恢复与语义定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18970 2026-08-24 cs.SE cs.AI 版本更新 62%

Skillware: A Software Ontology and Engineering Lifecycle for Persistent Behavioral Artifacts

Skillware:用于持久行为工件的软件本体与工程生命周期

Haodi Fan, Zucong Lan

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对智能体技能成为持久行为工件却缺乏相关软件本体的问题,引入Skillware,通过Skill Artifact和Skillware Unit管理工件,阐述相关条件与证据,为智能体能力提供可识别、可组合、可维护及可演化的软件本体与工程生命周期。

Comments 26 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18933 2026-08-20 cs.SE cs.AI 新提交 62%

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution

SkillForge:面向项目特定问题解决的自蒸馏智能体

Silin Chen, Han Li, Xiaodong Gu, Yuling Shi, Haibing Guan

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SkillForge是一种主动从代码库获取项目特定知识的自蒸馏框架,通过合成问题蒸馏技能,可提升LLM智能体解决特定代码库软件问题的性能。

Comments Our code and data are available at https://github.com/cslsolow/SkillForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14945 2026-08-18 cs.AI cs.CL 新提交 62%

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

信任并不足够:智能体强化学习中策略内自蒸馏的影响校准

Qizhen Lan, Xi Xiao, Xiangchen Guan, Mengchen Fan, Moule Lin, Jung Im Choi, Lijing Zhu

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 针对策略内自蒸馏的信任-效用不匹配问题,提出ICSD方法,在多基准任务上提升语言智能体性能,降低反向令牌的教师支持占比并提高梯度兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13675 2026-08-17 cs.LG cs.AI 新提交 62%

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

从BERT到前沿智能体:八年语言模型进展、能力-成本曲线的崩溃及任务定向模型的兴起

Pranav Kumar Kaliaperumal

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 该文梳理2018-2026年语言模型进展,发现2024年末后编码能力年提升近6倍、能力-成本曲线崩溃,专用模型成趋势,Qwen 2.5数学测试及置信度工具验证了相关结论,研究材料全公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07341 2026-08-13 cs.SE cs.LG 版本更新 62%

ReCodeAgent: A Multi-agent Workflow for Language-Agnostic Translation and Validation of Large-Scale Repositories

ReCodeAgent:一种多智能体工作流用于语言无关的大规模仓库翻译与验证

Ali Reza Ibrahimzada, Brandon Paulsen, Daniel Kroening, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.LG

AI总结 ReCodeAgent通过多智能体方法实现大规模仓库代码翻译与验证的语言无关性,提升翻译正确率并降低成本,验证其效率和设计影响。

Comments Published in ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20667 2026-08-13 cs.SE cs.AI 版本更新 62%

REVERE: Reflective Evolving Research Engineer

REVERE:面向科学工作流的反思性进化研究工程师

Balaji Dinesh Gangireddi, Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

机构 * TCS Research(TCS研究) Yale University(耶鲁大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 REVERE通过全局训练上下文学习和反思优化框架,提升科研编码任务性能,实现4.50%、3.51%和4.89%的提升。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09934 2026-08-12 cs.CL cs.AI 新提交 62%

LLM Agents Factory: Retrieval of Domain-Specific LLM Agents

LLM智能体工厂:领域特定大语言模型智能体的检索

Vitalii Belov, Artyom Sosedka, Andrey Sakhovskiy, Elizaveta Kovtun, Artyom Boyarskikh, Semen Budennyy

机构 * Sber AI Moscow Institute of Physics and Technology(莫斯科物理技术学院) National University of Science and Technology MISIS(莫斯科国立科学技术大学MISIS) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究所) Artificial Intelligence Research Institute(人工智能研究所)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出LLM Agents Factory框架,通过检索2万余个预设智能体配置文件按需构建领域特定智能体,在多基准测试中实现高准确率与低推理成本,为工业应用提供动态智能体生成的替代方案。

Comments 7 pages, 1 figure, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08377 2026-08-11 cs.AI cs.CL 版本更新 62%

SkillClaw: Let Skills Evolve Collectively with Agentic Evolver

SkillClaw: 让技能与代理进化者共同进化

Ziyu Ma, Shidong Yang, Yuxiang Ji, Xucong Wang, Yong Wang, Yiming Hu, Tongwen Huang, Xiangxiang Chu

机构 * DreamX Team(DreamX团队)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14219 2026-08-11 cs.LG cs.AI cs.DC 62%

A Survey on Inference Optimization Techniques for Mixture of Experts Models

Jiacheng Liu, Peng Tang, Wenfeng Wang, Yuhang Ren, Xiaofeng Hou, Pheng-Ann Heng, Minyi Guo, Chao Li

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

Comments Under Review

Journal ref ACM CSUR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05204 2026-08-10 cs.AI cs.LG 版本更新 62%

SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse

SkillTrace:面向LLM智能体技能复用的多溯源审计

Jialuo Chen, Minghe Wang, Lingqi Jiang, Jianan Ma, Xinhao Deng, Xiaohu Du, Ruixiao Lin, Yunhao Feng, Linkang Du, Jingyi Wang

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SKILLTRACE框架,通过提取三种溯源审计LLM智能体技能复用,在SKILLTRACE-BENCH上取得高指标,野外审计显示其能生成更具操作性的复用审查队列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12503 2026-08-06 cs.CL cs.AI 版本更新 62%

Topology-Aware Reasoning over Incomplete Knowledge Graph with Graph-Based Soft Prompting

基于拓扑的不完整知识图谱推理与图基软提示

Shuai Wang, Xixi Wang, Yinan Yu

机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏