arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-12 至 2026-02-12 共收录 9 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 9 篇

2602.10975 2026-02-12 cs.SE cs.AI 84%

FeatureBench: Benchmarking Agentic Coding for Complex Feature Development

FeatureBench: 评估代理编码在复杂特性开发中的性能

Qixing Zhou, Jiacheng Zhang, Haiyang Wang, Rui Hao, Jiahe Wang, Minghao Han, Yuxue Yang, Shuzhe Wu, Feiyang Pan, Lue Fan, Dandan Tu, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 FeatureBench通过基于执行的评估协议和自动化任务收集方法,评估代理在复杂特征开发中的性能,发现先进模型在该基准上表现有限,为提升代理编码能力提供新机会。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05941 2026-02-12 cs.SE cs.LG cs.MA 79%

Code2MCP: Transforming Code Repositories into MCP Services

Code2MCP: 将代码仓库转化为MCP服务

Chaoqian Ouyang, Ling Yue, Shimin Di, Libin Zheng, Linan Yue, Shaowu Pan, Jian Yin, Min-Ling Zhang

机构 * Sun Yat-sen University(中山大学) Rensselaer Polytechnic Institute(罗切斯特理工学院) Southeast University(东南大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.LG、cs.SE

AI总结 Code2MCP通过自动化将GitHub仓库转换为MCP兼容服务,解决现有MCP工具池不足的问题,促进MCP协议的普及与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10869 2026-02-12 cs.CR 78%

Agentic Knowledge Distillation: Autonomous Training of Small Language Models for SMS Threat Detection

代理知识蒸馏:自主训练小型语言模型用于短信威胁检测

Adel ElZemity, Joshua Sylvester, Budi Arief, Rogério De Lemos

专题命中 软件智能体 :agentic(title,abstract)

AI总结 本研究提出代理知识蒸馏方法,通过自主训练小型语言模型实现高效的短信威胁检测,实验显示教师LLM的选择对性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11000 2026-02-12 cs.DC cs.AI cs.LG 62%

Fine-Tuning GPT-5 for GPU Kernel Generation

为GPU内核生成微调GPT-5

Ali Tehrani, Yahya Emara, Essam Wissam, Wojciech Paluch, Waleed Atallah, Łukasz Dudziak, Mohamed S. Abdelfattah

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过强化学习微调GPT-5提升GPU内核生成性能,实现正确率和效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10153 2026-02-12 cs.CR cs.LG cs.SE 62%

Basic Legibility Protocols Improve Trusted Monitoring

基础可读性协议提升可信监控

Ashwin Sreevatsa, Sebastian Prasanna, Cody Rushing

机构 * Cambridge Boston Alignment Initiative (CBAI) Summer Research Fellowship(剑桥波士顿对齐计划暑期研究奖学金) Redwood Research(红木研究)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 本研究提出可读性协议,通过鼓励不受信任模型产生易于监控评估的行为,提升可信监控的安全性,同时增强监控者对诚实代码的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10758 2026-02-12 cs.SE 57%

Hidden Licensing Risks in the LLMware Ecosystem

LLM生态系统中的隐藏许可风险

Bo Wang, Yueyang Chen, Jieke Shi, Minghui Li, Yunbo Lyu, Yinan Wu, Youfang Lin, Zhou Yang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出LiAgent框架,通过LLM分析LLMware生态系统的许可证兼容性,显著提升检测性能,发现多个潜在的许可证冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10487 2026-02-12 cs.CR cs.SE 57%

Following Dragons: Code Review-Guided Fuzzing

跟随龙:基于代码审查的模糊测试

Viet Hoang Luu, Amirmohammad Pasdar, Wachiraphan Charoenwet, Toby Murray, Shaanan Cohney, Van-Thuan Pham

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 EyeQ通过利用代码审查中的开发者智能,指导模糊测试以发现更多安全关键的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05892 2026-02-12 cs.LG 57%

ContextBench: A Benchmark for Context Retrieval in Coding Agents

ContextBench: 一种用于编码代理代码上下文检索的基准测试

Han Li, Letian Zhu, Bohan Zhang, Rili Feng, Jiaming Wang, Yue Pan, Earl T. Barr, Federica Sarro, Zhaoyang Chu, He Ye

机构 * Nanjing University(南京大学) University College London(伦敦大学学院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 ContextBench通过评估编码代理在问题解决过程中代码上下文的检索能力,揭示了代理在上下文利用上的不足,为改进LLM在软件任务中的推理提供了新的研究方向。

Comments 36 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09612 2026-02-12 cs.SE 57%

Analyzing GitHub Issues and Pull Requests in nf-core Pipelines: Insights into nf-core Pipeline Repositories

分析 nf-core 流水线中的 GitHub 问题和拉取请求:对 nf-core 流水线仓库的洞察

Khairul Alam, Banani Roy

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过分析 nf-core 流水线的 GitHub 问题和拉取请求,揭示了开发和维护过程中面临的挑战,如工具开发、仓库维护及 CI 配置管理,并提出提升流水线可持续性和可重复性的方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏