arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7739 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 601 篇

2607.10557 2026-07-14 cs.CL 新提交 85%

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

UNIBROWSE:用于多模态浏览比较的数据到智能体框架

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07397 2026-07-09 cs.AI cs.DB 新提交 85%

Agentic Data Environments

智能体数据环境

Elaine Ang, Chenxi Huang, Georgios Liargkovas, Jerry Liu, Jinhui Liu, Nikos Pagonas, Charlie Summers, Haonan Wang, Jiakai Xu, Tianle Zhou, Yusen Zhang, Zhou Yu, Zhuo Zhang, Tianyi Peng, Kostis Kaffes, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 探讨智能体数据环境,其作为智能体运行的执行基础,既能增强智能体能力又保障安全。该环境拓宽了智能体运行的数据范围,改变了对数据系统的传统认知,有望在提升智能体效能同时控制故障成本。

Journal ref IEEE Data Bulletin Vol. 50 No. 1 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05773 2026-07-08 cs.AI 新提交 85%

Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning

超越静态评估:构建用于可扩展智能体强化学习的模拟环境

Akshay Arora, Ishan Nigam, Ashutosh Aggarwal, Shefali Bansal, Krishna Singh, Sweta Kumari, Nikhil Mittal, Shariq Farhan, Siddarth Malreddy

机构 * Uber AI Solutions(优步人工智能解决方案)

专题命中 工具调用 :agentic(title);agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 研究针对大语言模型成为自主智能体后传统静态评估失效的问题,引入AgenticAI-Supervisor平台,通过API和UI驱动构建强化学习环境,运用可验证执行结果、多维奖励塑造及严格验证测试,以客户支持智能体案例展示核心能力及未来工作重点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25836 2026-06-29 cs.AI 新提交 85%

AI Snitches Get Glitches: Towards Evading Agentic Surveillance

AI告密者出故障:走向规避智能体监控

Hyejun Jeong, Dzung Pham, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。

Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20570 2026-06-23 cs.NI cs.AI cs.DC cs.MA 新提交 85%

Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform

代理网络的基础设施:来自Agentverse平台的差距分析与架构

Robin Dey, Panyanon Viradecha

机构 * OpenHub Research(开放 hub 研究)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过实证审计Agentverse平台,识别出8类62项缺失能力,提出七层代理云栈参考架构,并规划了从存储到经济原语的五条关键演进路径,为2030年实现Web4代理云提供技术路线。

Comments 28 pages, 11 tables, 1 figure. Preprint, not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19242 2026-06-18 cs.SE 新提交 85%

Runtime Compliance Verification for AI Agents

AI代理的运行时合规性验证

Nafiseh Kahani, Masoud Barati, Diana Addae

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.SE

AI总结 提出C-Trace框架,通过运行时监控和形式化策略谓词,确保AI代理在工具调用和对话中遵守GDPR规则,将攻击成功率降至12%以下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 85%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.CL

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04686 2026-07-07 cs.CL cs.AI cs.SE 新提交 85%

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

ToolFailBench:诊断大语言模型智能体中的工具使用失败

Harsh Soni

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE;agentic(comments)

AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。

Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23623 2026-08-26 cs.SE cs.AI cs.LG 新提交 85%

When May an Agent Stop? Evidence-Carrying Termination for Tool-Using LLMs

智能体何时可以停止?带证据的工具使用大语言模型终止机制

Jason Liu

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究针对工具使用大语言模型的终止问题,提出带证据的终止(ECT)机制,经实验验证其能显著减少不安全完成与过早无支持终止,满足非劣效性要求,可实现成功恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19215 2026-07-22 cs.NI 新提交 85%

HACO: Hedged Agent Computing for Reliable LLM Systems

HACO:用于可靠大语言模型系统的套期保值代理计算

Enhan Li, Hongyang Du

专题命中 工具调用 :agent(title,abstract);tool use(abstract);workflow(abstract)

AI总结 研究大语言模型代理在长期工作流中角色到实例绑定边界的故障问题,提出HACO运行时控制方案,将角色请求视为可靠性约束选择问题,通过结合乐观排序与保守可靠性积累及经验收集更新配置文件,提高了模型在变化条件下的性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12586 2026-06-12 cs.CR 新提交 85%

Beyond Attack Success Rate: Examining Trigger Leakage in Vision-Language Agentic Systems

超越攻击成功率:视觉-语言智能系统中的触发器泄漏研究

Jiamin Chang, Salil Kanhere, Piotr Koniusz, Jason, Xue, Hammond Pearce

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract)

AI总结 本文提出“触发器泄漏”概念,量化视觉-语言智能系统中后门触发器在视觉或语义相近输入下意外激活隐藏行为的风险,并引入邻域泄漏率(NLR)指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08016 2026-06-09 cs.CV cs.AI cs.CL 新提交 84%

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院) Huawei Technologies Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。

Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28439 2026-08-31 cs.CL cs.AI 新提交 84%

Fidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extraction

保真度并不足够:智能体数据表提取的调度级检测工具

Qing Ye, Meng-Hsuan Lin

机构 * Infineon Technologies AG(英飞凌科技股份公司)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对智能体数据表提取,发现仅靠保真度不足,提出构建调度级工具,通过检查工具调用轨迹检测故障,验证了其对植入故障的检测能力及工具层的可移植性价值。

Comments Accepted at EMNLP 2026 Industry Track. 7 pages + appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26696 2026-08-28 cs.AI cs.CR cs.SE 新提交 84%

Five Primitives for Governing Autonomous AI Agents at Runtime

运行时管控自主AI智能体的五大原语

Jiten Oswal, John Cadeddu

机构 * Aurite AI(奥莱特人工智能公司)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 针对企业自主AI智能体管控的适配问题,提出发现、身份等五大运行时管控原语,描述其实现方案、成本及部分原语的开发状态。

Comments 14 pages, 2 figures, 1 table. Describes an implemented system in private pilot deployment; four of five primitives implemented

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 84%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 工具调用 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10042 2026-08-12 cs.LG cs.AI 新提交 84%

UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs

UserToolBench:用于工具使用类大语言模型个性化决策的用户画像隐藏型基准测试集

Xuexiong Yin, Zechuan Chen, Yongsen Zheng, Yuxiang Zhang, Jingyuan Yang, Bin Wang, Yubin Wang, Keze Wang

机构 * Sun Yat-Sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.LG

AI总结 UserToolBench是针对工具使用类大语言模型的基准测试集,可评估模型从交互历史推断用户偏好等个性化决策能力,实验发现当前模型在多工具协调等方面仍存瓶颈。

Comments 21pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26656 2026-07-30 cs.CR cs.AI cs.SE 新提交 84%

Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

图作为验证器:用于过程间漏洞检测的智能体强化学习

Yikun Li, Ting Zhang, Jiakun Liu, Jinfeng Jiang, Yuheng Yieh, Yixin Yang, Wen Bin Leow, Yide Yin, Yintong Huo, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对现有漏洞检测孤立处理函数的问题,提出基于CPG的智能体强化学习框架VulAgentRL,通过图验证设计可靠奖励并预热初始化策略,在仓库级划分下的严格指标及多场景中均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11042 2026-07-14 cs.SE cs.AI 新提交 84%

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

BackendForge:使用后端服务对智能端到端代码生成进行基准测试

Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) SCS, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07379 2026-07-09 cs.AI cs.LG 新提交 84%

Physics-Audited Agentic Discovery in Scientific Machine Learning

科学机器学习中的物理审核智能发现

Diab W. Abueidda, Bilal Ahmed, Panos Pantidis, Mostafa E. Mobasher

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) National Center for Supercomputing Applications, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校国家超级计算应用中心)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能科学机器学习中替代模型选择问题,提出物理审核智能SciML工作流程,先确定评分评估器,推导物理要求并检查候选者输出,搜索违规情况。通过数值示例验证,该方法能选到满足物理条件的替代模型,区别于仅靠综合分数的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03953 2026-07-07 cs.CL cs.AI 新提交 84%

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models

为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究

Alexander Somma, Isabelle Plante, Fred Premji

机构 * Sage.is AI-UI(Sage.is人工智能用户界面)

专题命中 工具调用 :AI agent(title);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。

Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03441 2026-07-07 cs.LG cs.AI 新提交 84%

No Time Like the Present: Agentic Test-Time Training for LLM Agents

机不可失:大语言模型智能体的测试时训练

Yanbo Wang, Jinhua Hao, Yuze Shi, Kun Yuan, Ming Sun

机构 * Kuaishou Technology(快手科技)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮智能体情节中的连续测试时训练,提出智能体测试时训练方法,通过token级重加权减少重复文本损失,构建并发服务系统,提升了在ALFWorld和SWE-bench Lite上的成功率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26474 2026-06-26 cs.LG cs.AI 新提交 84%

Localizing RL-Induced Tool Use to a Single Crosscoder Feature

将RL诱导的工具使用定位到单个交叉编码器特征

Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani, Bowen Cheng, Gustavo Mercier, Jessica Hullman

专题命中 工具调用 :tool use(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出专用特征交叉编码器(DFC)隔离强化学习引入的紧凑特征集,通过编码-解码重建提升工具调用正确率31.1个百分点,并实现能力溢出至冻结基模型。

Comments Accepted as a spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 84%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11543 2026-06-11 cs.AI cs.SE 新提交 84%

SkillJuror: Measuring How Agent Skill Organization Changes Runtime Behavior

SkillJuror:衡量智能体技能组织如何改变运行时行为

Zhiyu Chen, Zihan Guo, Bo Huang, Bingwei Lu, Jianghao Lin, Yuanjian Zhou, Weinan Zhang

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出SkillJuror框架,通过渐进式披露与扁平基线对比,发现技能组织方式改变智能体搜索和应用程序知识的行为,并在82个任务中提升4.1%的验证通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09138 2026-06-09 cs.LG cs.CL 新提交 84%

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Claw-R1:面向智能体强化学习的步骤级数据中间件系统

Daoyu Wang, Mingyue Cheng, Qingchuan Li, Shuo Yu, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 提出Claw-R1系统,通过网关服务器和数据池组件,将智能体交互步骤转化为结构化数据资产,支持实时检查、质量筛选和训练批次配置,解决智能体强化学习中数据生命周期管理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29063 2026-09-01 cs.AI 新提交 83%

Agent2UCB: Agentic System for Generative Engine Optimization

Agent2UCB:用于生成式引擎优化的智能系统

Sheldon Yu, Rui Wang, Tong Yu, Sungchul Kim, Doga Dogan, Junda Wu, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(奥多比研究院)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出智能GEO系统Agent2UCB,通过评估9种策略并结合多臂老虎机策略优化内容,在GEO-Bench实验中实现可见性提升且保留SEO质量,还提供SEO评估与演示功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29309 2026-09-01 cond-mat.mtrl-sci cs.AI physics.app-ph 新提交 83%

Evaluating LLM-based AI agents integrated with materials synthesis tools: the case of atomic layer deposition

评估集成了材料合成工具的基于大语言模型(LLM)的智能体:以原子层沉积为例

Angel Yanguas-Gil

专题命中 工具调用 :AI agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究以原子层沉积为案例,提出了评估集成材料合成工具的基于LLM的AI智能体的实用框架,涵盖多类基准并可推广至其他材料合成技术。

Comments Invited prospective paper submitted to MRS Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27796 2026-08-31 cs.AI 新提交 83%

ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL

ReToolSQL:用于鲁棒文本到SQL的智能体强化学习

Pratik Kakkar, Chandra Dhir, Ravi Shankar, Pareekshit Reddy Gaddam, Anup Shirgaonkar

机构 * JPMorganChase(摩根大通)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 ReToolSQL为文本到SQL提出两阶段训练框架,结合监督微调与智能体强化微调,在BIRD-SQL基准上取得高执行准确率,登顶单模型开发集排行榜,是实现企业级鲁棒文本到SQL的可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26623 2026-08-28 cs.AI 新提交 83%

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

AgentJudgeBench:用于评估智能体工具调用的多难度基准

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

机构 * ServiceNow AI(ServiceNow人工智能部门)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。

Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26563 2026-08-28 cs.CL 新提交 83%

SPT: Skills as Pre-Training Data for Agentic Language Models

SPT:将技能作为智能体语言模型的预训练数据

Yufei Sun, Yudong Li, Yiming Cheng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本研究提出技能预训练(SPT)方法,将公开技能包作为训练数据,结合参考感知组装策略,可提升智能体语言模型的工具使用性能,同时保留通用性能,验证了技能包作为预训练数据源的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏