arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-27 至 2026-08-27 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 11 篇

2608.25417 2026-08-27 cs.AI 新提交 87%

Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

绘制你所见:多模态智能体的灵巧视觉工具使用基准测试

Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

专题命中 工具调用 :tool use(title,abstract);agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文提出名为EASEL的基准测试,结合44万样本的EASEL-Data数据集与EASEL-9B模型,评估多模态智能体的灵巧视觉工具使用能力,发现现有25个模型在该任务上表现不佳,EASEL-9B相对基础模型提升6.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25037 2026-08-27 cs.AI cs.CL cs.DB cs.IR 新提交 86%

Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs

检索、匹配、升级:基于VLM蒸馏的交叉编码器与智能体VLMs的准确且可扩展的商品链接

Jian Wang, Steven Xu, Sanjyot Thete, Maryam Barouti, Tom Tang, Elaine Wu, Charu Sareen, Kyle MacDonald

机构 * DoorDash Inc.(DoorDash公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对大规模商品链接的成本与精度矛盾,提出“检索-匹配-升级”级联框架,用VLM蒸馏的交叉编码器处理多数简单案例,智能体VLM解决模糊案例,提升了链接覆盖率且降低成本。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21712 2026-08-27 cs.AI cs.MA 版本更新 85%

ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling

ATHENA:面向基于AutoFormer的电子健康记录建模的知识引导型智能体神经架构搜索

Deyi Li, Qi Xu, Lingyao Li, Tiansheng Wang, Muxuan Liang, Mei Liu

机构 * University of Florida(佛罗里达大学) University of Arizona(亚利桑那大学) University of Houston(休斯顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出知识引导型智能体NAS框架ATHENA,通过跨医院复用架构知识,在6项临床预测任务的12项评估中9项优于或匹配基线方法,可减少Transformer型EHR建模的手动架构调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25559 2026-08-27 cs.CV cs.AI 新提交 83%

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:面向视频深度研究的自适应工具使用与反思

Xintong Zhang, Xiaomeng Fan, Shilin Yan, Ekko He, Zicheng Liu, Zijian Zou, Guannan Zhang, Yuwei Wu, Zhi Gao, Hongwei Xue

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学)

专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27309 2026-08-27 cs.SE 版本更新 79%

SIGIL: Compiling Agent Skills into Typed Harnesses

SIGIL:将智能体技能编译为类型化工具框架

Jayanaka Dantanarayana, Savini Kashmira, Lingjia Tang, Jason Mars

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 SIGIL通过Skill Compilation将散文式智能体技能编译为类型化工具框架,提升了智能体执行技能要求步骤的比例、完整过程的频率并减少token使用,且效果与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27140 2026-08-27 cs.AI 版本更新 79%

StepOPSD: Step-Aware Online Preference Self-Distillation for Agent Reinforcement Learning

StepOPSD: 面向智能体强化学习的步骤感知在线偏好蒸馏

Yanfei Zhang, Xu Lin, Chenglin Wu

机构 * Independent Researcher(独立研究者) Tencent(腾讯) DeepWisdom(深智沃)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 提出StepOPSD框架,以智能体步骤为信用分配单元,通过事后增强教师上下文重新评分步骤段,并在GRPO更新前进行归一化每步信用预算的优势塑造,解决多轮智能体强化学习中的信用分配不匹配问题。

Comments Already been accepted as an EMNLP2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24957 2026-08-27 cs.CR cs.SE 新提交 74%

ToolMinimize: Auditing and Rewriting LLM Agent Tool Calls to Minimize Privacy Exposure

ToolMinimize:审计与重写大语言模型智能体的工具调用以最小化隐私暴露

Wenbiao Li, Yuqiao Xu

专题命中 工具调用 :agent(title);分类 cs.SE

AI总结 ToolMinimize是一款中间件,通过拦截并重写LLM智能体的工具调用参数,结合schema感知分析与四种操作,在保证100%任务有效性的同时大幅降低隐私暴露,可选层可进一步提升效果,延迟极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25198 2026-08-27 cs.AI 新提交 70%

Tunable Tool-Call Rates in LLM Agents via Representation Steering

通过表示调控实现LLM智能体中可调节的工具调用率

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

机构 * UC Santa Cruz(圣克鲁兹加利福尼亚大学) UC Berkeley(加利福尼亚大学伯克利分校)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究提出通过调控LLM残差流的线性方向,可在推理时无需额外训练调节工具调用率,使开放域问答准确率近翻倍,且能泛化到多种模型与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06087 2026-08-27 cs.CL cs.AI 版本更新 62%

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill: 从上下文文本技能到LLM智能体的权重内隐技能

Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出LatentSkill框架,通过预训练超网络将文本技能转换为即插即用的LoRA适配器,将技能知识存储在权重空间而非上下文空间,从而减少预填充令牌并提升性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24912 2026-08-27 cs.HC cs.AI 新提交 57%

Analyzing and Correcting Benevolence Bias in Large Language Models

分析与修正大语言模型中的善意偏差

Yuanzi Li, Junhao Wang, Minghui Liu, Boyi Li, Bingchen Chen, Zihang Tian, Jingyu Zhao, Yuhan Wang, Lei Wang, Pei Wang, Jinchao Wu, Xu Chen

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本研究识别出大语言模型存在的善意偏差,发现其稳定且随模型规模增大而增强,提出轻量对比校准法可修正该偏差,明确了对齐后的大语言模型作为人类替代者的适用场景与修正方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17889 2026-08-27 cs.IR cs.AI cs.CV 交叉投稿 57%

VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval

VisDocAgentBench:面向视觉丰富文档检索的智能体基准测试

Lexiang Hu, Yanzhao Zhang, Mingxin Li, Dingkun Long, Yikang Li, Fuwei Zhang, Yisen Wang, Zhouchen Lin

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 该研究提出VisDocAgentBench基准,对比静态与智能体检索,发现视觉检索优于OCR文本检索,智能体可改善双桥项检索性能,为检索智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏