arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5090 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5090 篇

2608.08907 2026-08-11 cs.CV cs.AI 新提交 77%

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

ToolVision:通过能力对齐监督学习何时以及如何使用视觉工具

Delin Mao, Chenghao Sun, Jingwei Song, Chishui Chen, Linfeng Zhang

专题命中 工具调用 :agent(abstract);tool use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对多模态模型工具使用监督错位问题,提出ToolVision方法,通过能力对齐的SFT与RL监督优化工具使用学习,在多个视觉基准上实现性能提升并将公开发布相关资源。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18414 2026-08-11 cs.CR cs.AI 版本更新 77%

Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control

提示不保护:通过MCP代理实现的架构强制以实现LLM工具访问控制

Rohith Uppala

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种受控的MCP代理,通过在工具发现和工具调用两个阶段实施基于属性的访问控制(ABAC),有效阻止了未经授权的工具调用,而提示基于的限制仅能减少11-18个百分点的未授权调用率,证明了架构强制在部署的智能体系统中实现可靠工具访问控制的必要性。

Comments 7 pages, 4 tables, 2 figures. Revised version with 200 adversarial tasks and expanded limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07223 2026-08-11 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 77%

TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories

TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估

Yen-Shan Chen, Sian-Yao Huang, Cheng-Lin Yang, Yun-Nung Chen

机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) National Taiwan University(国立台湾大学)

专题命中 工具调用 :autonomous agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。

Comments Accepted to Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00737 2026-08-07 cs.AI 版本更新 77%

To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

调用还是不调用:评估和优化LLM工具调用的框架

Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(博德姆鲁尔大学) UAR RC Trust(UAR RC信托)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 提出一个基于决策理论的框架,从必要性、效用和可负担性三个关键因素评估LLM的网页搜索工具调用决策,并训练轻量级估计器优化调用,提升任务性能。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02358 2026-08-04 cs.CL 新提交 77%

ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02101 2026-08-04 cs.CL 新提交 77%

Cross-Domain Hybrid OPD for Generalizable Search Agents

面向通用搜索智能体的跨域混合在线策略蒸馏

Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29250 2026-08-03 cs.CL 新提交 77%

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

Data Turnstile:面向函数调用数据生成的可扩展开源框架

Goutham Ramakrishnan, Megha Sharma

机构 * Amazon AGI(亚马逊AGI)

专题命中 工具调用 :tool-use(abstract);function calling(abstract);agentic(abstract);分类 cs.CL

AI总结 该研究提出开源框架Data Turnstile,可基于用户定义API规范生成高质量函数调用合成训练数据,经其微调的小型语言模型在BFCL、τ²-bench等基准上性能大幅提升,缩小了与更大规模模型的差距。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25415 2026-07-29 cs.AI 新提交 77%

A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain

一种用于使冻结的语言模型智能体学习领域的控制系统、数据集和方法

Debjyoti Paul

机构 * Meta AI

专题命中 工具调用 :tool-use(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 研究如何让冻结的语言模型智能体学习领域,核心方法是将框架视为特定动作空间,用经典强化学习在线学习策略并以多目标奖励评分,贡献包括用DSPy实例化系统并评估,还发布相关代码、任务套件、训练日志及部署方法。

Comments 8 pages, 1 figure, 3 tables. Code and dataset: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16038 2026-07-20 cs.AI 新提交 77%

SciForge: An AI-Native, Multimodal Workbench for Scientific Discovery

SciForge:用于科学发现的人工智能原生多模态工作台

SciForge Team, Zhangyang Gao, Minghao Fang, Yifei Liu, Hanhui Yang, Xinyu Gu, Shixiang Tang, Siqi Sun, Lei Bai, Cheng Tan, Mengdi Liu, Hao Wu, Shuizhou Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 SciForge针对科学工作中异构工件难保存为连贯可审计状态的问题,构建多模态工作台,围绕五个支柱运行,结合多种组件,通过多种应用场景展示实际影响,当前为桌面应用,未来深化团队协作且开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09421 2026-07-20 cs.CL 版本更新 77%

What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents

技能应记住什么?语言模型代理中成本感知技能重写的质量-成本权衡

Qinghua Xing, Yinda Chen, Yaping Jin, Zhenhe Wu, Bohan Lin, Hang Zhou, Xinghao Chen, Hanting Chen, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies(华为技术有限公司) Tianjin University(天津大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);分类 cs.CL

AI总结 研究语言模型代理中技能重写的质量-成本权衡,提出信息保留策略,在SkillsBench上实现成本降低7%-14.7%且保持验证质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10559 2026-07-14 cs.AI 新提交 77%

Large language model agents accelerate inverse design of metal-organic frameworks for gas separation

大语言模型智能体加速用于气体分离的金属有机框架的逆设计

Zhaolin Hu, Hehe Fan, Wangyihan Guo, Meng Xu, Chenhao Rao, Qiwei Yang, Yi Yang

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 研究旨在加速金属有机框架用于气体分离的逆设计。提出LEMO智能体框架,结合多种技术,经迭代循环指导搜索。在分离任务中评估,相比基线有优势,丰富候选、提性能、保多样,还经实验筛选实现合成与表征,证明大语言模型智能体可加速MOF发现。

Comments 19 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01143 2026-07-14 cs.AI 版本更新 77%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05876 2026-07-09 cs.PF cs.AI cs.DC 新提交 77%

Think Before You Grid-Search: Floor-First Triage for LLM Serving

在进行网格搜索之前先思考:大语言模型服务的楼层优先分类法

Yihua Liu

机构 * NVIDIA

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 研究大语言模型服务优化,提出楼层优先分类法,基于残差构建五维资源向量,通过墙排序比较部署方案,以案例分析模型在特定GPU上的情况,揭示布局判断与操作点的关系及不同布局差异的原因。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13148 2026-07-02 cs.AI 新提交 77%

TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?

TerraBench: 智能体能否对异构地球系统数据进行推理?

Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani, Huy M. Le, Muhammad Umer Sheikh, Numan Saeed, Muhammad Haris Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 工具调用 :tool-use(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出TerraBench基准,基于TerraAgent框架,通过结合大语言模型规划与科学工具,实现跨网格数据、卫星图像、地理空间和模拟器的交互式推理,包含403个任务和24,500个执行步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30531 2026-06-30 cs.AI 77%

Entity Binding Failures in Tool-Augmented Agents

工具增强型代理中的实体绑定失败

Rahul Suresh Babu, Shashank Indukuri

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 研究工具增强型语言模型代理中实体绑定失败问题,提出实体感知执行机制,实验表明该方法可消除错误实体操作但可能降低任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25605 2026-06-25 cs.CL 新提交 77%

Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints

开源大语言模型中的约束税:结构化输出约束下工具调用抑制的实证研究

Fangzheng Li, Aimin Zhang, Chen Lv

机构 * Focus AI Center, Focus Technology Co., Ltd.(焦点科技有限公司焦点人工智能中心) Nanjing University of Science and Technology(南京理工大学)

专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract);分类 cs.CL

AI总结 本文通过实验发现,在同时启用工具调用和JSON Schema约束时,多个开源模型会抑制工具调用,并提出透明两遍执行策略来恢复工具调用同时保证结构化输出。

Comments 2 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23132 2026-06-25 cs.CR cs.AI 版本更新 77%

Verifiable Manifest Signing and Transparency Enforcement for Secure MCP-Based LLM Pipelines

可验证的清单签名与透明度强制:面向基于MCP的安全LLM流水线

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Foutse Khomh, Mohammad Hamdaqa

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院) SæT Laboratory, Polytechnique Montréal(SæT实验室,蒙特利尔理工学院)

专题命中 工具调用 :agent(abstract);tool-use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对MCP协议缺乏工具清单认证的问题,提出清单级强制层,通过策略验证、新鲜度检查、数字签名、执行前验证和Merkle透明度日志,实现低开销、可追溯的LLM工具调用安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16591 2026-06-17 cs.CL 新提交 77%

SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents

SING: 用于LLM代理中可扩展主动工具发现的合成意图图

Qiao Xiao, Haochen Shi, Yisen Gao, Wenbin Hu, Huihao Jing, Tianshi Zheng, Baixuan Xu, Ziheng Zhang, Weiqi Wang, Haoran Li, Jiaxin Bai, Yangqiu Song

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科技大学) The Ohio State University(俄亥俄州立大学) Hong Kong Baptist University(香港浸会大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 提出SING框架,通过构建意图-工具图并动态检索工具,在长周期任务中提升工具发现准确率,Global Recall@5提高59.8%,下游成功率提高28.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10875 2026-06-10 cs.CL 新提交 77%

Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation

通过经验知识集成与激活推动LLM工具调用极限

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 工具调用 :autonomous agent(abstract);tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 研究如何通过经验知识获取、激活和内化提升LLM多步工具调用性能,提出知识增强工具执行框架KATE,结合宽度扩展推理与知识感知训练,在BFCL-V3和AppWorld上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07867 2026-06-09 cs.CL 新提交 77%

The Cold-Start Safety Gap in LLM Agents

LLM智能体中的冷启动安全差距

Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 工具调用 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.CL

AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02963 2026-06-03 cs.LG 77%

KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators

KForge:面向AI加速器的LLM驱动跨平台内核生成

Taras Sereda, Burak Bartan, Ankita Nayak, Tom St. John, Natalie Serrino, Zain Asgar

机构 * Gimlet Labs Inc(Gimlet实验室)

专题命中 工具调用 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出KForge框架,通过两个协作的LLM代理(生成代理和性能分析代理)迭代优化,自动生成跨平台高性能内核,在NVIDIA B200和Intel Arc B580上分别实现2.12%的吞吐量提升和5.13倍的几何平均加速。

Comments Accepted at ISCA 2026 Workshop MLArchSys

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31268 2026-06-01 cs.CL 77%

Mellum2 Technical Report

Mellum2 技术报告

Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

机构 * JetBrains Constructor University(Constructor大学)

专题命中 工具调用 :tool use(abstract);function calling(abstract);agentic(abstract);分类 cs.CL

AI总结 本文介绍 Mellum 2,一个12B参数(每token激活2.5B)的混合专家语言模型,专攻软件工程,通过架构创新和训练优化在代码生成、数学推理等基准上达到4B-14B开源模型的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI 77%

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);分类 cs.AI

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26691 2026-05-27 cs.AI 77%

Mind the Tool Failures: Achieving Synergistic Tool Gains for Medical Agents

注意工具故障:实现医疗智能体的协同工具增益

Yunhui Gan, Tan Pan, Kaiyu Guo, Limei Han, Weimiao Yu, Guangnan Ye, Chen Jiang, Yuan Cheng

机构 * Fudan University(复旦大学) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) The University of Queensland(昆士兰大学) Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR)(生物信息研究所(BII),科技研究局(A*STAR))

专题命中 工具调用 :AI agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 针对医疗AI智能体在真实临床环境中工具可能失败的问题,提出基于GRPO的强化学习框架,通过实例级工具选择和分歧感知协同学习,实现错误工具共识的纠正,提升系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17774 2026-05-27 cs.CL 77%

Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning

通过QLoRA微调将工具知识内化到小型语言模型中

Yuval Shemla, Ayal Yakobe, Tanmay Agarwal, Dhaval Patel, Kaoutar El Maghraoui

机构 * Columbia School of General Studies, Columbia University, NY, USA(哥伦比亚大学泛研学院) Columbia Engineering, Columbia University, NY, USA(哥伦比亚大学工程学院) IBM Research, NY, USA(IBM研究院)

专题命中 工具调用 :tool-use(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 本文研究通过QLoRA参数高效微调将工具知识内化到小型语言模型中,在AssetOpsBench基准上,微调后的Gemma 4 E4B和Qwen3-4B模型在无描述推理下优于有完整工具描述的未微调基线,输入长度减少82.6%,规划分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13360 2026-05-15 cs.LG 77%

Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling

推测交互代理:构建具有异步I/O和推测性工具调用的实时代理

Coleman Hooper, Minwoo Kang, Suhong Moon, Nicholas Lee, Eric Wen, John Wawrzynek, Michael W. Mahoney, Yakun Sophia Shao, Amir Gholami, Kurt Keutzer

机构 * University of California, Berkeley(加州大学伯克利分校) ICSI LBNL(劳伦斯伯克利国家实验室)

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出推测交互代理,通过异步I/O和推测性工具调用,实现复杂多轮工具调用的实时交互,提升实时应用性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04712 2026-05-12 cs.CV cs.AI eess.IV 77%

SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation

SAR-RAG:通过语义搜索、检索和MLLM生成实现目标识别的视觉问答

David F. Ramirez, Tim Overman, Kristen Jaskie, Joe Marvin, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司)

专题命中 工具调用 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出SAR-RAG方法,结合多模态大语言模型和语义嵌入向量数据库,通过语义搜索和检索提升SAR图像目标识别的准确性,通过分类和回归指标验证效果。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08904 2026-05-12 cs.AI 77%

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract);分类 cs.AI

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03294 2026-04-27 cs.CR cs.AI 77%

AgentMark: Utility-Preserving Behavioral Watermarking for Agents

AgentMark:用于代理的效用保持行为水印

Kaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huaqiao University(华侨大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出AgentMark,一种用于代理的行为水印方法,通过在规划决策中嵌入多比特标识符以保持效用,适用于黑盒API和动作层内容水印。

Comments Accepted to ACL 2026 (Main, Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06879 2026-04-14 cs.IR cs.AI 77%

WisPaper: Your AI Scholar Search Engine

WisPaper:你的AI学者搜索引擎

Li Ju, Jun Zhao, Mingxu Chai, Ziyu Shen, Xiangyang Wang, Yage Geng, Chunchun Ma, Hao Peng, Guangbin Li, Tao Li, Chengyong Liao, Fu Wang, Xiaolong Wang, Junshen Chen, Rui Gong, Shijia Liang, Feiyan Li, Ming Zhang, Kexin Tan, Junjie Ye, Zhiheng Xi, Shihan Dou, Tao Gui, Yuankai Ying, Yang Shi, Yue Zhang, Qi Zhang

机构 * Fudan University(复旦大学)

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出WisPaper,一种端到端代理系统,通过整合模块解决学术文献搜索中的语义限制和工作流程碎片化问题,提升文献发现、组织和跟踪效率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏