arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5118 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5118 篇

2607.13389 2026-07-16 cs.LG cs.CL 新提交 62%

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

强化学习训练后计算资源应投向何处?模型大小、搜索、学习与反馈

Patrick Wilhelm, Odej Kao

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 工具调用 :planning(abstract);分类 cs.CL、cs.LG

AI总结 研究强化学习训练后计算资源分配问题,引入浮点运算核算框架,通过LoRA适配的Qwen2.5策略发现条件分配前沿,揭示模型选择与训练分配关联及奖励系统对核算影响,提出RACE协议,建议相关论文报告总浮点运算及计算分配方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00830 2026-07-16 cs.LG cs.AI 版本更新 62%

Learning to Learn-at-Test-Time: Language Agents with Learnable Adaptation Policies

在测试时学习:具有可学习适应策略的语言智能体

Zhanzhi Lou, Hui Chen, Yibo Li, Qian Wang, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Meta-TTL框架,通过双层优化问题学习最优适应策略,提升语言智能体在不同分布下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11874 2026-07-14 cs.RO cs.AI cs.LG 新提交 62%

A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation

一种用于灵巧操作的极简重定向引导强化学习方法

Yunhai Feng, Natalie Leung, Jiaxuan Wang, Lujie Yang, Haozhi Qi, Preston Culbertson

机构 * Cornell University(康奈尔大学) Amazon FAR(亚马逊FAR)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 研究如何将重定向引导强化学习用于灵巧操作,提出REGRIND方法,从单人演示学习策略,经重定向、模拟训练、零样本转移到硬件,在丰富接触任务中产生类人行为,还分析了模拟到现实转移的关键因素。

Comments Website: https://yunhaifeng.com/REGRIND

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10555 2026-07-14 cs.IR cs.AI cs.CL 新提交 62%

Tool-Adaptive LLM Reranker

工具自适应语言模型重排器

Zichuan Liu, Ruijin Hua

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对生成式大语言模型在复杂查询时的事实幻觉及重排延迟问题,提出TALRanker框架,将相关性评分形式化为马尔可夫决策过程,经两阶段训练优化,在检索基准上性能领先,兼顾吞吐量与准确性。

Comments 12 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10208 2026-07-14 cs.LG cs.AI 新提交 62%

Exploratory Analysis of Deep Learning Models for Forecasting Meteorological Parameters in the Agricultural Sector

农业领域气象参数预测深度学习模型的探索性分析

Piotr Sikora, Sotirios Kontogiannis

机构 * Lodz Universtiy of Technlogy(罗兹工业大学) MicroComputer Systems Laboratory(微计算机系统实验室) University of Ioannina(约阿尼纳大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究对深度学习架构进行比较评估,用于农业气象参数多变量预测,利用希腊约阿尼纳的观测数据,对比多种模型在24小时次日和168小时提前一周预测任务中的表现,发现混合模型在短期预测中更优且参数更少。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09822 2026-07-14 cs.CV cs.AI cs.CL cs.HC cs.IR 新提交 62%

Memory-Conditioned Tool Calling for Camera-First Visual Agents

用于相机优先视觉智能体的内存条件工具调用

Xiaofan Wu, Xi Zeng, Miaoxia Chen, Peishan Chen, Shuyan Li, Jiyun Yao, Hanyong Zhong, Jiahao Zhu

机构 * Chance AI(机遇人工智能公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究在相机优先视觉智能体中个人视觉记忆对工具选择等的影响,采用三层视觉记忆调节大语言模型工具调用循环,通过对800张图像与合成内存块实验发现,移除三层内存块会降低工具查询相关性和端到端效用。

Comments 13 pages, 3 figures, 4 tables. Equal contribution: Xiaofan Wu, Xi Zeng. Corresponding author: xiaofan@chance.vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14499 2026-07-14 cs.AI cs.LG 版本更新 62%

Measuring AI Ability to Complete Long Software Tasks

衡量AI完成长期软件任务的能力

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) Ohm Chip Anthropic

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出50%任务完成时间跨度指标,用于衡量AI在完成长期软件任务方面的能力,结果显示AI模型的时间跨度呈指数增长,预计5年后将能自动化许多人类月度完成的软件任务。

Comments v4: added Chris Painter as listed author, consistent with listing in the pdf

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22294 2026-07-13 cs.CL cs.AI 版本更新 62%

SLIDERS: Systematic Reviews via Automated Evidence Synthesis and Reconciliation

上下文从不够长:用于长文档集可扩展问答的结构化推理

Harshit Joshi, Priyank Shethia, Jadelynn Dao, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SLIDERS框架,通过结构化推理解决长文档集问答问题,利用关系数据库和SQL实现可扩展推理,优于现有基准。

Comments 53 pages (10 main), preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07721 2026-07-10 cs.AI cs.LG 新提交 62%

Context Graphs for Proactive Enterprise Agents

用于主动企业智能体的上下文图

Avinash Kumar

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在让企业智能体更主动,提出上下文图结构,定义相关检测引擎、评分器和呈现层,形式化组件并给出Python实现,经案例研究评估,该方法提升了Precision@5,降低误报率和平均呈现时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07626 2026-07-09 cs.CL cs.AI 新提交 62%

Future Confidence Distillation in Large Language Models

大语言模型中的未来置信度蒸馏

Sahil Kale

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 研究大语言模型置信度估计,通过比较解决问题前后的置信度,发现其在回答过程中演变。基于此引入未来置信度蒸馏,用解决问题后的置信度估计训练解决问题前隐藏表征的预测器,实现可靠且低成本的置信度估计。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07184 2026-07-09 cs.LG cs.AI 新提交 62%

Predicting LLM Safety Before Release by Simulating Deployment

通过模拟部署预测大语言模型发布前的安全性

Marcus Williams, Hannah Sheahan, Cameron Raymond, Tomek Korbak, Deng Pan, Peilin Yang, Leon Maksin, Ningyi Xie, Phillip Guo, Ian Kivlichan, Micah Carroll

机构 * OpenAI(开放人工智能研究公司)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13059 2026-07-02 cs.LG cs.AI 版本更新 62%

Competition-Aware CPC Forecasting with Near-Market Coverage

竞争感知的CPC预测与近市场覆盖

Sebastian Frey, Edoardo Beccari, Maximilian Kranz, Nicolò Alberto Pellizzari, Ali Mete Karaman, Qiwei Han, Maximilian Kaiser

机构 * Nova School of Business and Economics(新里斯本大学商业与经济学院) University of Hamburg(汉堡大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对付费搜索中部分可观测的竞争环境,提出结合语义邻域、行为邻域和地理意向协变量的竞争感知CPC预测方法,在短期(1周)图模型降低sMAPE 15.1%,长期(6-12周)协变量增强基础模型降低sMAPE 22.5%-27.6%。

Comments 17 pages, 2 figures, 6 tables, European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML/PKDD), the code is availale at https://github.com/Sebastian-Frey/Competition-Aware-GNNs-for-TimeSeriesForecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00994 2026-06-30 cs.CL cs.AI 62%

Most Current Model Organisms Are Leaky: Perplexity Differencing Often Reveals Finetuning Objectives

模型生物体是泄漏的:困惑度差分经常揭示微调目标

Mohammed Abu Baker, Luca Baroni, Dan Wilhelm

机构 * Meridian Visiting Researcher Programme(Meridian 访问研究员计划)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过困惑度差分方法揭示模型生物体的微调目标,无需模型内部信息或先验假设,适用于多种微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26815 2026-06-30 cs.CL cs.AI cs.IR 62%

Sustainable Hybrid Document-Routed Retrieval for Financial RAG: Resolving the Robustness-Precision Trade-off

通过混合文档路由检索解决金融RAG中的鲁棒性与精度权衡

Zhiyuan Cheng, Longying Lai, Yue Liu

机构 * organization= School of Engineering, Stanford University , city= Stanford , state= CA , country= USA organization= Simon Business School, University of Rochester , city= Rochester , state= NY , country= USA organization= Accounting \& Information Systems, Rutgers University , city= Newark , state= NJ , country= USA

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出混合文档路由检索方法,通过结合语义文件路由与分块检索,解决金融文档问答中鲁棒性与精度的权衡问题,提升检索性能。

Comments 26 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16682 2026-06-29 cs.LG cs.CL 新提交 62%

Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

多模态评估者偏好坍缩:自进化智能体中的跨模态传染

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 工具调用 :AI agent(abstract);分类 cs.CL、cs.LG

AI总结 研究多模态自评估中偏好坍缩的加剧现象,发现跨模态传染导致策略选择扭曲,并引入传染矩阵量化风险。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03217 2026-06-29 cs.CL cs.AI cs.CY cs.IR 版本更新 62%

Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification

混合事实核查:集成知识图谱、大语言模型和基于搜索的检索代理提高可解释的声明验证

Shaghayegh Kolli, Richard Rosenbaum, Timo Cavelius, Lasse Strothe, Andrii Lata, Jana Diesner

机构 * Technical University Munich(慕尼黑工业大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种混合事实核查方法,集成知识图谱、大语言模型和实时搜索代理,通过三步流水线(KG检索、LM分类、Web搜索)在FEVER基准上达到0.93 F1分数,无需微调,并有效处理信息不足情况。

Comments Paper has been accepted at 9th wiNLP workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25394 2026-06-25 cs.LG cs.AI 新提交 62%

FactorLibrary: From Polynomials to Circuits via Recursive Subgoals

FactorLibrary: 从多项式到电路通过递归子目标

Rohan Pandey, Michael Ruofan Zeng, Weikun K. Zhang, Kaijie Jin, Naomi Morato, Archit Ganapule, Bhaumik Mehta, Jarod Alper

机构 * University of Washington, Seattle, WA, USA(华盛顿大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 将有限域上多项式的最小算术电路发现建模为强化学习问题,提出FactorLibrary存储可分解子表达式作为子目标,使用PPO+MCTS的top-down方法在复杂度8以内达到91.8%的成功率。

Comments 14 pages, 8 figures, in 3rd AI for Math Workshop (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17698 2026-06-24 cs.AI cs.CL 新提交 62%

EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent

EComAgentBench:在分布式隐藏意图的长时任务上基准测试购物代理

Zeyao Du, Tong Li, Yanci Zhang, Haibo Zhang

机构 * Shopee

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出EComAgentBench基准,包含662个基于真实亚马逊产品的任务,要求代理在100次工具调用内从可见查询、工具门控配置文件和脚本化澄清中挖掘隐藏意图,验证候选产品并提交最终选择,通过类型化源标签评分归因失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10607 2026-06-24 cs.LG cs.AI 62%

MONAQ: Multi-Objective Neural Architecture Querying for Time-Series Analysis on Resource-Constrained Devices

MONAQ:面向资源受限设备的时间序列分析多目标神经架构查询

Patara Trirat, Jae-Gil Lee

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MONAQ通过多目标神经架构查询框架,结合大语言模型能力,实现对时间序列数据的高效处理与部署,实验表明其模型性能优于传统方法。

Comments EMNLP 2025 (Findings), Project Page: https://kaist-dmlab.github.io/MONAQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21975 2026-06-23 cs.AI cs.LG 新提交 62%

IRumAI: Reinforcement Learning for Indian Rummy

IRumAI: 面向印度拉米纸牌游戏的强化学习

Vignesh Mohan

机构 * IEEE

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出首个面向印度拉米纸牌游戏的强化学习智能体IRumAI,采用PPO、融合感知编码、死牌驱动奖励和双分支卷积架构,在仅对弱启发式训练后,以53.9%胜率击败最强搜索对手,推理速度比最优启发式快7000倍以上。

Comments 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21456 2026-06-23 cs.IR cs.AI cs.CL 版本更新 62%

Revisiting Text Ranking in Deep Research

重新审视深度研究中的文本排序

Chuan Meng, Litu Ou, Sean MacAvaney, Jeff Dalton

机构 * The University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过复现实验,从检索单元、流水线配置和查询特性三个角度评估文本排序方法在深度研究中的有效性,并提出Q2Q方法缓解查询不匹配问题。

Comments Accepted at the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20529 2026-06-19 cs.AI cs.CL 新提交 62%

LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

LedgerAgent: 策略遵从工具调用代理的结构化状态

Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) University of Arizona(亚利桑那大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对客服领域策略遵从工具调用代理,提出LedgerAgent方法,通过独立账本维护任务状态并渲染到提示中,在执行工具调用前检查状态依赖策略约束,提升多轮一致性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19559 2026-06-19 cs.AI cs.CL 新提交 62%

Uncertainty Decomposition for Clarification Seeking in LLM Agents

LLM代理中寻求澄清的不确定性分解

Gregory Matsnev

机构 * AI Talent Hub, ITMO University(AI Talent Hub, ITMO大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使代理能在任务规范模糊时主动寻求澄清,在五个LLM骨干上平均澄清F1提升36%-73%。

Comments 26 pages, 8 figures. Source code: https://github.com/PE51K/udcs-in-llm-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19423 2026-06-19 cs.CR cs.AI cs.LG 版本更新 62%

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15077 2026-06-16 cs.AI cs.CL 新提交 62%

Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation

风险感知的LLM智能体用于地理空间数据检索:设计与初步对抗性评估

Kyle Gao, Joel Cumming, Jonathan Li, Linlin Xu, David A. Clausi

机构 * Dept. of Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系) SkyWatch Dept. of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系) Dept. of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种基于LLM的框架,通过自然语言查询从云地理空间目录检索遥感数据,集成三个智能体实现安全、意图解析和API调用生成,初步对抗实验表明提示级安全指令提升鲁棒性但需系统级防御。

Comments Accepted for publication in the International Archives of the Photogrammetry, Remote Sensing and Spatial Information Sciences (ISPRS Archives), ISPRS Congress 2026

Journal ref Int. Arch. Photogramm. Remote Sens. Spatial Inf. Sci., XLIX-B3-2026, 1419-1426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11522 2026-06-11 cs.AI cs.LG 新提交 62%

Search Discipline for Long-Horizon Research Agents

长周期研究智能体的搜索纪律

Adithya Srinivasan, Devesh Paragiri

机构 * North Carolina State University(北卡罗来纳州立大学) University of Maryland(马里兰大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对研究智能体使用聚合指标评估候选方案导致科学有效性反转的问题,提出一种外部审计协议,基于分解行为而非单一分数进行决策。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16700 2026-06-10 cs.SE cs.AI cs.ET cs.HC 版本更新 62%

Adoption of Generative Artificial Intelligence in the German Software Engineering Industry: An Empirical Study

生成式人工智能在德国软件工程行业的采用:一项实证研究

Ludwig Felder, Tobias Eisenreich, Mahsa Fischer, Stefan Wagner, Chunyang Chen

机构 * Technical University of Munich(慕尼黑技术大学) Heilbronn University of Applied Science(海德堡应用科学大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.SE

AI总结 通过混合方法研究德国软件工程师采用生成式AI工具的情况,发现经验水平调节感知收益,组织规模影响工具选择和使用强度,项目上下文意识不足是主要障碍。

Comments Accepted at FSE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09416 2026-06-09 cs.RO cs.AI cs.SE 新提交 62%

Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer

面向物理AI的驾驭工程:机器人中间件即驾驭层

Sanghoon Lee, Jiyeong Chae, Kyung-Joon Park

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出机器人中间件作为物理AI的驾驭层,需同时干预控制、计算和通信,并补充投影、隔离和转移三种缺失的强制功能,以ROS 2驾驭配置文件为例。

Comments 6 pages, 2 figures, 2 tables. Big Ideas track submission to the 27th ACM/IFIP International Middleware Conference (Middleware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07904 2026-06-09 cs.AI cs.SE 新提交 62%

Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

Contract2Tool: 学习可靠工具增强型LLM代理的前提条件和效果

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出Contract2Tool框架,从元数据、文档和执行轨迹中推断工具契约,实现因果工具过滤,在保持可靠性的同时大幅减少工具选择和token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏