arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-10 至 2026-02-10 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 15 篇

2602.08082 2026-02-10 cs.LG cs.AI eess.SP 86%

Spectral Guardrails for Agents in the Wild: Detecting Tool Use Hallucinations via Attention Topology

野生环境中代理的频谱护栏:通过注意力拓扑检测工具使用幻觉

Valentin Noël

机构 * Devoteam

专题命中 工具调用 :tool use(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 通过分析注意力拓扑谱,提出一种无需训练数据的防护方法,有效检测代理幻觉,揭示模型错误时注意力噪声特征。

Comments 32 pages, 2 fgures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08401 2026-02-10 cs.AI cs.CR 85%

On Protecting Agentic Systems' Intellectual Property via Watermarking

通过水印技术保护代理系统知识产权

Liwen Wang, Zongjie Li, Yuchong Xie, Shuai Wang, Dongdong She, Wei Wang, Juergen Rahmel

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出AGENTWM框架,通过水印技术保护代理系统知识产权,有效抵御适应性对手的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07652 2026-02-10 cs.CR cs.AI 85%

Agent-Fence: Mapping Security Vulnerabilities Across Deep Research Agents

Agent-Fence: 在深度研究代理中映射安全漏洞

Sai Puppala, Ismail Hossain, Md Jahangir Alam, Yoonpyo Lee, Jay Yoo, Tanzim Ahad, Syed Bahauddin Alam, Sajedul Talukder

机构 * Computer Science Department, Southern Illinois University(索尔坦大学计算机科学系) Computer Science Department, University of Texas(德克萨斯大学计算机科学系) Hanyang University(翰阳大学) The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格雷格尔工程学院)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 Agent-Fence通过定义14种信任边界攻击类别,评估深度代理的安全性,发现高风险类别如Denial-of-Wallet和Authorization Confusion,揭示代理在持久交互中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26553 2026-02-10 cs.CL cs.PL 85%

Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling

迈向可靠的基准测试:一种无污染、可控的多步骤LLM功能调用评估框架

Seiji Maekawa, Jackson Hassell, Pouya Pezeshkpour, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 工具调用 :function calling(title);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 本文提出FuncBenchGen框架,通过生成多步骤工具使用任务评估LLM功能调用能力,发现依赖深度增加导致性能下降,引入重申变量值策略提升模型表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07983 2026-02-10 cs.AI cs.CL 81%

Accelerating Social Science Research via Agentic Hypothesization and Experimentation

通过代理假设和实验加速社会科学研究

Jishu Sen Gupta, Harini SI, Somesh Kumar Singh, Syed Mohamad Tawseeq, Yaman Kumar Singla, David Doermann, Rajiv Ratn Shah, Balaji Krishnamurthy

机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究所)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 EXPERIGEN通过代理框架实现端到端的科学发现,发现更多显著且预测性强的假设,并通过A/B测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01476 2026-02-10 cs.AI cs.CL cs.LG 80%

Tree Search for Language Model Agents

语言模型代理的树搜索

Jing Yu Koh, Stephen McAleer, Daniel Fried, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种树搜索算法,用于提升语言模型代理在现实网页任务中的表现,实验显示其在成功率上显著优于基线方法。

Comments 13 pages. Models and code available at https://jykoh.com/search-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08400 2026-02-10 cs.AI 79%

SCOUT-RAG: Scalable and Cost-Efficient Unifying Traversal for Agentic Graph-RAG over Distributed Domains

SCOUT-RAG:可扩展且成本效益高的代理图式检索框架用于分布式领域

Longkun Li, Yuanben Zou, Jinghan Wu, Yuqing Wen, Jing Li, Hangwei Qian, Ivor Tsang

机构 * A*STAR

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 SCOUT-RAG是一种分布式代理图式检索框架,通过跨领域检索和增量效用目标提升推理性能,同时降低成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07035 2026-02-10 cs.AI cs.LG 73%

DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents

DLLM-Searcher: 为搜索代理适应扩散大语言模型

Jiahao Zhao, Shaoxuan Xu, Zhongxiang Sun, Fengqi Zhu, Jingyang Ou, Yuling Shi, Chongxuan Li, Xiao Zhang, Jun Xu

机构 * Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 DLLM-Searcher通过优化基于dLLM的搜索代理,解决代理能力不足和延迟挑战,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08941 2026-02-10 cs.HC cs.AI 70%

pixelLOG: Logging of Online Gameplay for Cognitive Research

pixelLOG:用于认知研究的在线游戏日志记录

Zeyu Lu, Dennis L. Barbour

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 pixelLOG是一种用于认知研究的高性能数据收集框架,通过混合方法跟踪多人游戏中的行为,实现高分辨率分析。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13240 2026-02-10 cs.LG 70%

Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions

知道你所知道的并不足够:大型语言模型的置信度与行为不一致

Arka Pal, Teo Kitanovski, Arthur Liang, Akilesh Potti, Micah Goldblum

机构 * Vanderbilt University(范德比大学) MIT(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.LG

AI总结 研究发现大型语言模型的置信度与行为不一致,静态校准无法预测动态设置中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21475 2026-02-10 cs.NE cs.AI cs.LG 62%

Task-free Adaptive Meta Black-box Optimization

无需任务的自适应元黑盒优化

Chao Wang, Licheng Jiao, Lingling Li, Jiaxuan Zhao, Guanchun Wang, Fang Liu, Shuyuan Yang

机构 * Xidian University(西安电子科技大学) Tianjin Research Institute for Water Transport Engineering, M.O.T.(天津水运工程研究院)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 ABOM通过闭环自适应参数学习机制,在无需预定义任务分布的情况下实现零样本黑盒优化。

Comments This article was published as a conference paper (oral) at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08312 2026-02-10 astro-ph.GA 50%

CFHT MegaCam Two Deep Fields Imaging Survey (2DFIS) I: Overview

CFHT MegaCam 两深场成像调查(2DFIS)I:概述

Binyang Liu, Wentao Luo, Martin Kilbinger, Shenming Fu, Ian Dell'Antonio, Liping Fu, Xian Zhong Zheng, Yi-fu Cai, Cheng Jia, Ning Jiang, Qinxun Li, Yicheng Li, Shurui Lin, Christopher J. Miller, Surhud S. More, Huiyuan Wang, Yibo Wang

专题命中 工具调用 :workflow(abstract)

AI总结 2DFIS项目利用CFHT MegaCam对两个天体物理区域进行深场成像,旨在研究快速射电暴源及旋转星系团的质量分布,通过高精度数据处理为相关宇宙学研究提供基础数据。

Comments 28 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08211 2026-02-10 cs.CV 50%

Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension

Chain-of-Caption: 无需训练提升多模态大语言模型的指称表达理解

Yik Lung Pang, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院)

专题命中 工具调用 :tool use(abstract)

AI总结 本文提出无需训练的Chain-of-Caption框架,通过结合多种上下文提升多模态大语言模型在指称表达理解任务中的性能。

Comments 4 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11195 2026-02-10 cs.CR 50%

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

SoK:通过信息流和不对称威胁的全局博弈论分析,多模态基础模型的安全-安全性连续体

Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

专题命中 工具调用 :agent(abstract)

AI总结 本文通过信息流和博弈论分析,探讨多模态基础模型的安全与安全性连续体,提出系统级防护优于模型级防护,并定义自我破坏阈值以触发终止机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18123 2026-02-10 math.GR 50%

Property $R_\infty$ for new classes of Artin groups

性质 $R_\infty$ 对新类别的Artin群的性质

Ignat Soroko, Nicolas Vaskou

专题命中 工具调用 :tool use(abstract)

AI总结 本文研究了新类别的Artin群的$R_\infty$性质,通过自同构群和超曲面作用的分析,并提供了Delzant引理的证明。

Comments V2: added a detailed proof of Delzant's Lemma; minor edits throughout the text. 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏