arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-12 至 2026-02-12 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2505.17512 2026-02-12 cs.AI cs.CL 87%

Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark

你的大语言模型真的掌握了概念吗?一个多智能体基准

Shuhang Xu, Weijian Deng, Yixuan Zhou, Fangwei Zhong

机构 * Beijing Normal University(北京师范大学) Australian National University(澳大利亚国立大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.CL

AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08412 2026-02-12 cs.AI 86%

From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent

从助手到双代理:形式化和评估 OpenClaw 对个性化本地 AI 代理的攻击

Yuhang Wang, Feiming Xu, Zheng Lin, Guangyu He, Yuzhe Huang, Haichang Gao, Zhenxing Niu, Shiguo Lian, Zhaoxiang Liu

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出个性化代理安全评估框架 PASB,用于评估 OpenClaw 在现实部署中的安全风险,揭示其在多个执行阶段的关键漏洞。

Comments 11 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05016 2026-02-12 cs.HC cs.AI cs.CY cs.ET 85%

From Fragmentation to Integration: Exploring the Design Space of AI Agents for Human-as-the-Unit Privacy Management

从碎片到整合:探索面向人类作为单元的隐私管理的AI代理设计空间

Eryue Xu, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过研究用户隐私管理挑战,提出九个AI代理概念,发现后分享管理工具在用户信任度上表现突出,展示了AI代理在整合隐私管理中的潜力。

Journal ref CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10620 2026-02-12 cs.SE cs.CL 81%

ISD-Agent-Bench: A Comprehensive Benchmark for Evaluating LLM-based Instructional Design Agents

ISD-Agent-Bench: 一个用于评估基于大语言模型的教学系统设计代理的全面基准

YoungHoon Jeon, Suwan Kim, Haein Son, Sookbun Lee, Yeil Jeong, Unggi Lee

机构 * Upstage Opentutorials Indiana University Bloomington(印第安纳大学布卢明顿分校) Korea University Sejong Campus(韩国大学世宗校区)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 ISD-Agent-Bench通过结合经典ISD理论与现代推理方法,为评估基于LLM的教学系统设计代理提供了全面的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22130 2026-02-12 cs.AI cs.SE 73%

World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems

世界工作流:一个将世界模型引入企业系统的基准

Lakshya Gupta, Litao Li, Yizhe Liu, Sriram Ganapathi Subramanian, Kaheer Suleman, Zichen Zhang, Haoye Lu, Sumit Pasupalak

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 World of Workflows提出一个基于ServiceNow的企业系统基准,揭示前沿LLMs在动态建模中的盲区,并强调基于现实世界建模的可靠性需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10453 2026-02-12 cs.CR cs.CL 70%

The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis

大语言模型代理中提示注入威胁的图景:从分类到分析

Peiran Wang, Xinfeng Li, Chong Xiang, Jinghuai Zhang, Ying Li, Lixia Zhang, Xiaofeng Wang, Yuan Tian

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文综述了大语言模型代理中提示注入威胁的分类与分析,提出AgentPI基准以评估依赖上下文交互的代理行为,揭示现有防御的局限性并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10367 2026-02-12 cs.AI 70%

LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation

LiveMedBench: 一个无污染的医疗基准测试,用于具有自动评分评估的LLM

Zhiling Yan, Dingjie Song, Zhe Fang, Yisheng Ji, Xiang Li, Quanzheng Li, Lichao Sun

机构 * Lehigh University(莱维大学) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 LiveMedBench通过持续更新和自动评分框架,提供无污染的医疗基准测试,验证LLM在临床推理中的性能,揭示数据污染和上下文适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10131 2026-02-12 cs.SI cs.AI cs.CY 70%

The Anatomy of the Moltbook Social Graph

Moltbook社交图谱的解剖

David Holtz

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究分析Moltbook平台中AI代理的社交图谱特征,揭示其幂律参与度、小世界连接性及非人类对话模式,探讨智能体社交的独特性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 70%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10171 2026-02-12 cs.SE cs.AI 62%

EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems

EvoCodeBench:用于自演化LLM驱动编码系统的性能基准

Wentao Zhang, Jianfeng Wang, Liheng Liang, Yilei Zhao, HaiBin Wen, Zhe Zhao

机构 * Nanyang Technological University(南洋理工大学) East China University of Science and Technology(东华大学) Guangdong Ocean University(广东海洋大学) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 EvoCodeBench通过跨语言对比和人类表现评估,评估自演化LLM驱动编码系统的性能提升与效率改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07651 2026-02-12 cs.AI cs.GT cs.LG cs.MA 62%

Active Evaluation of General Agents: Problem Definition and Comparison of Baseline Algorithms

通用智能体的主动评估:问题定义与基线算法比较

Marc Lanctot, Kate Larson, Ian Gemp, Michael Kaisers

机构 * Google DeepMind(谷歌DeepMind) Google DeepMind, University of Waterloo(谷歌深Mind、滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通用智能体的主动评估框架,通过比较基线算法发现Elo系统在实践中可靠,而Soft Condorcet Optimization在真实评估中表现更优。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15927 2026-02-12 cs.CL cs.AI 62%

Generative Prompt Internalization

生成性提示内化

Haebin Shin, Lei Ji, Yeyun Gong, Sungdong Kim, Eunbi Choi, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 生成性提示内化通过联合训练方法实现复杂提示的内化,减少计算开销并提升模型性能。

Comments NAACL 2025 (Main Conference)

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01273 2026-02-12 cs.LG 57%

Learning-based agricultural management in partially observable environments subject to climate variability

基于气候变化的农业管理学习方法

Zhaoan Wang, Shaoping Xiao, Junchao Li, Jun Wang

机构 * Department of Mechanical Engineering, Iowa Technology Institute, University of Iowa(机械工程系、爱荷华技术研究所、爱荷华大学) Department of Chemical and Biochemical Engineering, Iowa Technology Institute, University of Iowa(化学与生物化学工程系、爱荷华技术研究所、爱荷华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究提出基于深度强化学习和RNN的农业管理框架,通过模拟实验展示其在应对气候变化和极端天气下的适应性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11048 2026-02-12 math.OC 50%

Adversarial Graph Traversal

对抗性图遍历

David Banks, Elvan Ceyhan, Leah Johnson, Li Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过对抗性风险分析,研究贝叶斯代理人如何在存在对手干扰的情况下优化图遍历路径选择,强调主观分布和贝叶斯先验对决策优势的影响。

Comments 10 pages, 4 figures. Simulation study included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10960 2026-02-12 q-fin.ST cs.CE econ.EM q-fin.RM stat.CO 50%

Integrating granular data into a multilayer network: an interbank model of the euro area for systemic risk assessment

将颗粒数据整合到多层网络中:欧元区的银行间模型用于系统性风险评估

Ilias Aarab, Thomas Gottron, Andrea Colombo, Jörg Reddig, Annalauro Ianiro

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种整合多层网络的欧元区银行间模型,用于系统性风险评估,通过整合监管数据和统计数据,揭示了不同传导渠道的异质性,并展示了其在风险分析中的应用。

Journal ref Adv Data Anal Classif (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10851 2026-02-12 cs.GT cs.DS 50%

Near-Feasible Stable Matchings: Incentives and Optimality

近可行稳定匹配:激励与最优性

Frederik Glitzner

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了近可行稳定匹配的稳定性与激励问题,提出框架分析代理激励并证明容量修改在个体和群体层面的最优性,同时提供高效算法和实验结果。

Comments EA to appear at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10821 2026-02-12 econ.TH 50%

Bayesian Persuasion under Bias Management

在偏见管理下的贝叶斯说服

Kemal Ozbek

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在偏见管理下的贝叶斯说服问题,分析了信息获取与偏见管理的相互作用,揭示了它们在不同模型参数下的互补或替代关系。

详情

展开后加载摘要…

URL PDF HTML 收藏