arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-12 至 2026-02-12 共收录 100 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 6 篇

2602.10454 2026-02-12 cs.CL 57%

LATA: A Tool for LLM-Assisted Translation Annotation

LATA:一个辅助翻译标注的工具

Baorong Huang, Ali Asiri

机构 * School of Foreign Languages, Huaihua University(怀化大学外语学院) Alith University College, Umm al-Qura University(乌姆·阿尔·库拉大学阿利思大学学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 LATA是一个利用大语言模型辅助的翻译标注工具,旨在提高标注效率的同时保持语言学精度,适用于结构差异大的语言对。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10872 2026-02-12 cond-mat.dis-nn cond-mat.mtrl-sci 50%

On generating Special Quasirandom Structures: Optimization for the DFT computational efficiency

关于生成特殊随机结构:优化DFT计算效率

Andrzej P. Kądzielawa

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种优化DFT计算效率的进化算法,用于生成特殊随机结构,通过减少位移数量显著降低计算成本。

Comments 9 pages, 2 block of pseudocode, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03609 2026-02-12 stat.AP 50%

Scalable non-separable spatio-temporal Gaussian process models for large-scale short-term weather prediction

可扩展的非分离时空高斯过程模型用于大尺度短期天气预测

Tim Gyger, Reinhard Furrer, Fabio Sigrist

专题命中 工作流自动化 :planning(abstract)

AI总结 本文提出可扩展的非分离时空高斯过程模型,用于大尺度短期天气预测,通过改进的近似方法和GPU加速实现高效准确的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10121 2026-02-12 physics.geo-ph 50%

Comparison of generative algorithms for conceptual groundwater modeling of coastal volcanic aquifer features with disparate, sparse and extremely imbalanced data

概念性地下水建模中生成算法的比较:用于沿海火山含水层特征的异质、稀疏且极度不平衡数据

Michael J. Friedel

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究提出了一种人工智能辅助的工作流程,通过生成算法整合异质、稀疏且极度不平衡的数据,以提高沿海火山含水层概念性地下水模型的准确性。

Comments 47 pages, 15 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 9 篇

2602.10975 2026-02-12 cs.SE cs.AI 84%

FeatureBench: Benchmarking Agentic Coding for Complex Feature Development

FeatureBench: 评估代理编码在复杂特性开发中的性能

Qixing Zhou, Jiacheng Zhang, Haiyang Wang, Rui Hao, Jiahe Wang, Minghao Han, Yuxue Yang, Shuzhe Wu, Feiyang Pan, Lue Fan, Dandan Tu, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 FeatureBench通过基于执行的评估协议和自动化任务收集方法,评估代理在复杂特征开发中的性能,发现先进模型在该基准上表现有限,为提升代理编码能力提供新机会。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05941 2026-02-12 cs.SE cs.LG cs.MA 79%

Code2MCP: Transforming Code Repositories into MCP Services

Code2MCP: 将代码仓库转化为MCP服务

Chaoqian Ouyang, Ling Yue, Shimin Di, Libin Zheng, Linan Yue, Shaowu Pan, Jian Yin, Min-Ling Zhang

机构 * Sun Yat-sen University(中山大学) Rensselaer Polytechnic Institute(罗切斯特理工学院) Southeast University(东南大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.LG、cs.SE

AI总结 Code2MCP通过自动化将GitHub仓库转换为MCP兼容服务,解决现有MCP工具池不足的问题,促进MCP协议的普及与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10869 2026-02-12 cs.CR 78%

Agentic Knowledge Distillation: Autonomous Training of Small Language Models for SMS Threat Detection

代理知识蒸馏:自主训练小型语言模型用于短信威胁检测

Adel ElZemity, Joshua Sylvester, Budi Arief, Rogério De Lemos

专题命中 软件智能体 :agentic(title,abstract)

AI总结 本研究提出代理知识蒸馏方法,通过自主训练小型语言模型实现高效的短信威胁检测,实验显示教师LLM的选择对性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11000 2026-02-12 cs.DC cs.AI cs.LG 62%

Fine-Tuning GPT-5 for GPU Kernel Generation

为GPU内核生成微调GPT-5

Ali Tehrani, Yahya Emara, Essam Wissam, Wojciech Paluch, Waleed Atallah, Łukasz Dudziak, Mohamed S. Abdelfattah

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过强化学习微调GPT-5提升GPU内核生成性能,实现正确率和效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10153 2026-02-12 cs.CR cs.LG cs.SE 62%

Basic Legibility Protocols Improve Trusted Monitoring

基础可读性协议提升可信监控

Ashwin Sreevatsa, Sebastian Prasanna, Cody Rushing

机构 * Cambridge Boston Alignment Initiative (CBAI) Summer Research Fellowship(剑桥波士顿对齐计划暑期研究奖学金) Redwood Research(红木研究)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 本研究提出可读性协议,通过鼓励不受信任模型产生易于监控评估的行为,提升可信监控的安全性,同时增强监控者对诚实代码的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10758 2026-02-12 cs.SE 57%

Hidden Licensing Risks in the LLMware Ecosystem

LLM生态系统中的隐藏许可风险

Bo Wang, Yueyang Chen, Jieke Shi, Minghui Li, Yunbo Lyu, Yinan Wu, Youfang Lin, Zhou Yang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出LiAgent框架,通过LLM分析LLMware生态系统的许可证兼容性,显著提升检测性能,发现多个潜在的许可证冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10487 2026-02-12 cs.CR cs.SE 57%

Following Dragons: Code Review-Guided Fuzzing

跟随龙:基于代码审查的模糊测试

Viet Hoang Luu, Amirmohammad Pasdar, Wachiraphan Charoenwet, Toby Murray, Shaanan Cohney, Van-Thuan Pham

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 EyeQ通过利用代码审查中的开发者智能,指导模糊测试以发现更多安全关键的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05892 2026-02-12 cs.LG 57%

ContextBench: A Benchmark for Context Retrieval in Coding Agents

ContextBench: 一种用于编码代理代码上下文检索的基准测试

Han Li, Letian Zhu, Bohan Zhang, Rili Feng, Jiaming Wang, Yue Pan, Earl T. Barr, Federica Sarro, Zhaoyang Chu, He Ye

机构 * Nanjing University(南京大学) University College London(伦敦大学学院)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 ContextBench通过评估编码代理在问题解决过程中代码上下文的检索能力,揭示了代理在上下文利用上的不足,为改进LLM在软件任务中的推理提供了新的研究方向。

Comments 36 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09612 2026-02-12 cs.SE 57%

Analyzing GitHub Issues and Pull Requests in nf-core Pipelines: Insights into nf-core Pipeline Repositories

分析 nf-core 流水线中的 GitHub 问题和拉取请求:对 nf-core 流水线仓库的洞察

Khairul Alam, Banani Roy

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过分析 nf-core 流水线的 GitHub 问题和拉取请求,揭示了开发和维护过程中面临的挑战,如工具开发、仓库维护及 CI 配置管理,并提出提升流水线可持续性和可重复性的方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 4 篇

2602.11123 2026-02-12 cs.LG cond-mat.mtrl-sci 79%

From Natural Language to Materials Discovery:The Materials Knowledge Navigation Agent

从自然语言到材料发现:材料知识导航代理

Genmao Zhuang, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.LG

AI总结 材料知识导航代理通过自然语言处理技术,实现了材料发现的自动化和智能化,能够从文献和数据库中提取关键信息,提出新的材料候选方案。

Comments 22 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10814 2026-02-12 cs.AI 77%

See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch

见、计划、快照:评估Scratch中的多模态GUI代理

Xingyi Zhang, Yulei Ye, Kaifeng Huang, Wenhao Li, Xiangfeng Wang

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出ScratchWorld基准,用于评估多模态GUI代理在Scratch中的程序构建能力,揭示了推理与执行之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10225 2026-02-12 quant-ph cs.AI cs.IT eess.SP math.IT 57%

Quantum Integrated Sensing and Computation with Indefinite Causal Order

具有不定因果顺序的量子集成传感与计算

Ivana Nikoloska

机构 * Signal Processing Systems Group, Department of Electrical Engineering, Eindhoven University of Technology, Eindhoven, 5612 AP, The Netherlands(埃因霍温理工大学电气工程系信号处理系统组)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种在量子不定因果顺序框架下集成传感与计算的方案,通过量子代理同时执行状态观测和计算任务,实现了在磁导航任务中的高效性能。

Comments Submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10547 2026-02-12 cs.RO 50%

ReSPEC: A Framework for Online Multispectral Sensor Reconfiguration in Dynamic Environments

ReSPEC:动态环境中在线多光谱传感器重新配置框架

Yanchen Liu, Yuang Fan, Minghui Zhao, Xiaofan Jiang

机构 * Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 ReSPEC框架通过强化学习实现动态多光谱传感器重新配置,提升机器人在复杂环境下的感知效率与资源利用率。

Comments 8 pages, 4 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 4 篇

2601.21557 2026-02-12 cs.AI cs.NE 83%

Meta Context Engineering via Agentic Skill Evolution

通过代理技能进化实现元上下文工程

Haoran Ye, Xuning He, Vincent Arak, Haonan Dong, Guojie Song

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出元上下文工程(MCE),通过代理技能进化提升上下文优化效果,实现更灵活的上下文生成与适应性。

Comments 46 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11037 2026-02-12 physics.soc-ph cs.MA 78%

Generalized Langevin Models of Linear Agent-Based Systems: Strategic Influence Through Environmental Coupling

线性基于代理系统的一般化 Langevin 模型:通过环境耦合实现战略影响

Semra Gunduc, David J. Butts, Michael S. Murillo

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 本文提出了一种基于一般化 Langevin 方程的线性代理系统模型,通过环境耦合揭示记忆效应和战略影响机制。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10652 2026-02-12 cs.CL 57%

UMEM: Unified Memory Extraction and Management Framework for Generalizable Memory

UMEM: 通用记忆的统一记忆提取与管理框架

Yongshi Ye, Hui Jiang, Feihu Jiang, Tian Lan, Yichao Du, Biao Fu, Xiaodong Shi, Qianghuai Jia, Longyue Wang, Weihua Luo

机构 * Xiamen University(厦门大学) Alibaba International Digital Commerce(阿里巴巴国际数字商务) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 UMEM通过联合优化大语言模型,实现记忆的提取与管理,提升记忆的泛化能力,实验显示在多轮交互任务中表现优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10491 2026-02-12 cs.CV 50%

Towards Remote Sensing Change Detection with Neural Memory

基于神经记忆的遥感变化检测

Zhenyu Yang, Gensheng Pei, Yazhou Yao, Tianfei Zhou, Lizhong Ding, Fumin Shen

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科技大学)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 本文提出ChangeTitans框架,通过整合神经记忆与分段局部注意力,提升遥感变化检测的长距离依赖捕捉能力,同时保持计算效率,实验表明在多个数据集上取得最佳性能。

Comments accepted by IEEE Transactions on Geoscience & Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 17 篇

2505.17512 2026-02-12 cs.AI cs.CL 87%

Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark

你的大语言模型真的掌握了概念吗?一个多智能体基准

Shuhang Xu, Weijian Deng, Yixuan Zhou, Fangwei Zhong

机构 * Beijing Normal University(北京师范大学) Australian National University(澳大利亚国立大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.CL

AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08412 2026-02-12 cs.AI 86%

From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent

从助手到双代理:形式化和评估 OpenClaw 对个性化本地 AI 代理的攻击

Yuhang Wang, Feiming Xu, Zheng Lin, Guangyu He, Yuzhe Huang, Haichang Gao, Zhenxing Niu, Shiguo Lian, Zhaoxiang Liu

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出个性化代理安全评估框架 PASB,用于评估 OpenClaw 在现实部署中的安全风险,揭示其在多个执行阶段的关键漏洞。

Comments 11 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05016 2026-02-12 cs.HC cs.AI cs.CY cs.ET 85%

From Fragmentation to Integration: Exploring the Design Space of AI Agents for Human-as-the-Unit Privacy Management

从碎片到整合:探索面向人类作为单元的隐私管理的AI代理设计空间

Eryue Xu, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过研究用户隐私管理挑战,提出九个AI代理概念,发现后分享管理工具在用户信任度上表现突出,展示了AI代理在整合隐私管理中的潜力。

Journal ref CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10620 2026-02-12 cs.SE cs.CL 81%

ISD-Agent-Bench: A Comprehensive Benchmark for Evaluating LLM-based Instructional Design Agents

ISD-Agent-Bench: 一个用于评估基于大语言模型的教学系统设计代理的全面基准

YoungHoon Jeon, Suwan Kim, Haein Son, Sookbun Lee, Yeil Jeong, Unggi Lee

机构 * Upstage Opentutorials Indiana University Bloomington(印第安纳大学布卢明顿分校) Korea University Sejong Campus(韩国大学世宗校区)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 ISD-Agent-Bench通过结合经典ISD理论与现代推理方法,为评估基于LLM的教学系统设计代理提供了全面的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22130 2026-02-12 cs.AI cs.SE 73%

World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems

世界工作流:一个将世界模型引入企业系统的基准

Lakshya Gupta, Litao Li, Yizhe Liu, Sriram Ganapathi Subramanian, Kaheer Suleman, Zichen Zhang, Haoye Lu, Sumit Pasupalak

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 World of Workflows提出一个基于ServiceNow的企业系统基准,揭示前沿LLMs在动态建模中的盲区,并强调基于现实世界建模的可靠性需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10453 2026-02-12 cs.CR cs.CL 70%

The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis

大语言模型代理中提示注入威胁的图景:从分类到分析

Peiran Wang, Xinfeng Li, Chong Xiang, Jinghuai Zhang, Ying Li, Lixia Zhang, Xiaofeng Wang, Yuan Tian

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文综述了大语言模型代理中提示注入威胁的分类与分析,提出AgentPI基准以评估依赖上下文交互的代理行为,揭示现有防御的局限性并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10367 2026-02-12 cs.AI 70%

LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation

LiveMedBench: 一个无污染的医疗基准测试,用于具有自动评分评估的LLM

Zhiling Yan, Dingjie Song, Zhe Fang, Yisheng Ji, Xiang Li, Quanzheng Li, Lichao Sun

机构 * Lehigh University(莱维大学) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 LiveMedBench通过持续更新和自动评分框架,提供无污染的医疗基准测试,验证LLM在临床推理中的性能,揭示数据污染和上下文适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10131 2026-02-12 cs.SI cs.AI cs.CY 70%

The Anatomy of the Moltbook Social Graph

Moltbook社交图谱的解剖

David Holtz

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究分析Moltbook平台中AI代理的社交图谱特征,揭示其幂律参与度、小世界连接性及非人类对话模式,探讨智能体社交的独特性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 70%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏