arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 518 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 518 篇

2607.10208 2026-07-14 cs.LG cs.AI 新提交 62%

Exploratory Analysis of Deep Learning Models for Forecasting Meteorological Parameters in the Agricultural Sector

农业领域气象参数预测深度学习模型的探索性分析

Piotr Sikora, Sotirios Kontogiannis

机构 * Lodz Universtiy of Technlogy(罗兹工业大学) MicroComputer Systems Laboratory(微计算机系统实验室) University of Ioannina(约阿尼纳大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究对深度学习架构进行比较评估,用于农业气象参数多变量预测,利用希腊约阿尼纳的观测数据,对比多种模型在24小时次日和168小时提前一周预测任务中的表现,发现混合模型在短期预测中更优且参数更少。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09822 2026-07-14 cs.CV cs.AI cs.CL cs.HC cs.IR 新提交 62%

Memory-Conditioned Tool Calling for Camera-First Visual Agents

用于相机优先视觉智能体的内存条件工具调用

Xiaofan Wu, Xi Zeng, Miaoxia Chen, Peishan Chen, Shuyan Li, Jiyun Yao, Hanyong Zhong, Jiahao Zhu

机构 * Chance AI(机遇人工智能公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究在相机优先视觉智能体中个人视觉记忆对工具选择等的影响,采用三层视觉记忆调节大语言模型工具调用循环,通过对800张图像与合成内存块实验发现,移除三层内存块会降低工具查询相关性和端到端效用。

Comments 13 pages, 3 figures, 4 tables. Equal contribution: Xiaofan Wu, Xi Zeng. Corresponding author: xiaofan@chance.vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07721 2026-07-10 cs.AI cs.LG 新提交 62%

Context Graphs for Proactive Enterprise Agents

用于主动企业智能体的上下文图

Avinash Kumar

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在让企业智能体更主动,提出上下文图结构,定义相关检测引擎、评分器和呈现层,形式化组件并给出Python实现,经案例研究评估,该方法提升了Precision@5,降低误报率和平均呈现时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07626 2026-07-09 cs.CL cs.AI 新提交 62%

Future Confidence Distillation in Large Language Models

大语言模型中的未来置信度蒸馏

Sahil Kale

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 研究大语言模型置信度估计,通过比较解决问题前后的置信度,发现其在回答过程中演变。基于此引入未来置信度蒸馏,用解决问题后的置信度估计训练解决问题前隐藏表征的预测器,实现可靠且低成本的置信度估计。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07184 2026-07-09 cs.LG cs.AI 新提交 62%

Predicting LLM Safety Before Release by Simulating Deployment

通过模拟部署预测大语言模型发布前的安全性

Marcus Williams, Hannah Sheahan, Cameron Raymond, Tomek Korbak, Deng Pan, Peilin Yang, Leon Maksin, Ningyi Xie, Phillip Guo, Ian Kivlichan, Micah Carroll

机构 * OpenAI(开放人工智能研究公司)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 研究通过模拟部署预测大语言模型发布前安全性的方法,从去识别化对话出发,固定前缀用候选模型生成回复来评估。该方法能估计行为不当率,优于基线,还能克服工具重新采样挑战,为外部研究提供途径,助力预测模型现实行为及评估部署风险。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16682 2026-06-29 cs.LG cs.CL 新提交 62%

Multimodal Evaluator Preference Collapse: Cross-Modal Coupling in Self-Evolving Agents

多模态评估者偏好坍缩:自进化智能体中的跨模态传染

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 工具调用 :AI agent(abstract);分类 cs.CL、cs.LG

AI总结 研究多模态自评估中偏好坍缩的加剧现象,发现跨模态传染导致策略选择扭曲,并引入传染矩阵量化风险。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25394 2026-06-25 cs.LG cs.AI 新提交 62%

FactorLibrary: From Polynomials to Circuits via Recursive Subgoals

FactorLibrary: 从多项式到电路通过递归子目标

Rohan Pandey, Michael Ruofan Zeng, Weikun K. Zhang, Kaijie Jin, Naomi Morato, Archit Ganapule, Bhaumik Mehta, Jarod Alper

机构 * University of Washington, Seattle, WA, USA(华盛顿大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 将有限域上多项式的最小算术电路发现建模为强化学习问题,提出FactorLibrary存储可分解子表达式作为子目标,使用PPO+MCTS的top-down方法在复杂度8以内达到91.8%的成功率。

Comments 14 pages, 8 figures, in 3rd AI for Math Workshop (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17698 2026-06-24 cs.AI cs.CL 新提交 62%

EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent

EComAgentBench:在分布式隐藏意图的长时任务上基准测试购物代理

Zeyao Du, Tong Li, Yanci Zhang, Haibo Zhang

机构 * Shopee

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出EComAgentBench基准,包含662个基于真实亚马逊产品的任务,要求代理在100次工具调用内从可见查询、工具门控配置文件和脚本化澄清中挖掘隐藏意图,验证候选产品并提交最终选择,通过类型化源标签评分归因失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21975 2026-06-23 cs.AI cs.LG 新提交 62%

IRumAI: Reinforcement Learning for Indian Rummy

IRumAI: 面向印度拉米纸牌游戏的强化学习

Vignesh Mohan

机构 * IEEE

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出首个面向印度拉米纸牌游戏的强化学习智能体IRumAI,采用PPO、融合感知编码、死牌驱动奖励和双分支卷积架构,在仅对弱启发式训练后,以53.9%胜率击败最强搜索对手,推理速度比最优启发式快7000倍以上。

Comments 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20529 2026-06-19 cs.AI cs.CL 新提交 62%

LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

LedgerAgent: 策略遵从工具调用代理的结构化状态

Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) University of Arizona(亚利桑那大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对客服领域策略遵从工具调用代理,提出LedgerAgent方法,通过独立账本维护任务状态并渲染到提示中,在执行工具调用前检查状态依赖策略约束,提升多轮一致性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19559 2026-06-19 cs.AI cs.CL 新提交 62%

Uncertainty Decomposition for Clarification Seeking in LLM Agents

LLM代理中寻求澄清的不确定性分解

Gregory Matsnev

机构 * AI Talent Hub, ITMO University(AI Talent Hub, ITMO大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使代理能在任务规范模糊时主动寻求澄清,在五个LLM骨干上平均澄清F1提升36%-73%。

Comments 26 pages, 8 figures. Source code: https://github.com/PE51K/udcs-in-llm-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15077 2026-06-16 cs.AI cs.CL 新提交 62%

Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation

风险感知的LLM智能体用于地理空间数据检索:设计与初步对抗性评估

Kyle Gao, Joel Cumming, Jonathan Li, Linlin Xu, David A. Clausi

机构 * Dept. of Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系) SkyWatch Dept. of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系) Dept. of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种基于LLM的框架,通过自然语言查询从云地理空间目录检索遥感数据,集成三个智能体实现安全、意图解析和API调用生成,初步对抗实验表明提示级安全指令提升鲁棒性但需系统级防御。

Comments Accepted for publication in the International Archives of the Photogrammetry, Remote Sensing and Spatial Information Sciences (ISPRS Archives), ISPRS Congress 2026

Journal ref Int. Arch. Photogramm. Remote Sens. Spatial Inf. Sci., XLIX-B3-2026, 1419-1426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11522 2026-06-11 cs.AI cs.LG 新提交 62%

Search Discipline for Long-Horizon Research Agents

长周期研究智能体的搜索纪律

Adithya Srinivasan, Devesh Paragiri

机构 * North Carolina State University(北卡罗来纳州立大学) University of Maryland(马里兰大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对研究智能体使用聚合指标评估候选方案导致科学有效性反转的问题,提出一种外部审计协议,基于分解行为而非单一分数进行决策。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09416 2026-06-09 cs.RO cs.AI cs.SE 新提交 62%

Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer

面向物理AI的驾驭工程:机器人中间件即驾驭层

Sanghoon Lee, Jiyeong Chae, Kyung-Joon Park

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出机器人中间件作为物理AI的驾驭层,需同时干预控制、计算和通信,并补充投影、隔离和转移三种缺失的强制功能,以ROS 2驾驭配置文件为例。

Comments 6 pages, 2 figures, 2 tables. Big Ideas track submission to the 27th ACM/IFIP International Middleware Conference (Middleware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07904 2026-06-09 cs.AI cs.SE 新提交 62%

Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

Contract2Tool: 学习可靠工具增强型LLM代理的前提条件和效果

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出Contract2Tool框架,从元数据、文档和执行轨迹中推断工具契约,实现因果工具过滤,在保持可靠性的同时大幅减少工具选择和token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06566 2026-06-08 cs.SE cs.AI 新提交 62%

NTILC: Neural Tool Invocation via Learned Compression

NTILC: 通过学习的压缩实现神经工具调用

Andrew Krikorian, Yayuan Li, Jason J. Corso

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) Department of ECE, University of Michigan(电子工程与计算机科学系,密歇根大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出NTILC框架,用学习的潜在检索替代上下文工具查找,将工具选择与参数生成解耦,通过签名感知复合损失函数提升选择精度,相比基线减少95%上下文消耗和74%延迟。

Comments 10 Pages, 4 Figures, 5 Tables, 1 Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15089 2026-08-18 cs.AI 新提交 61%

StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

StateM:通过工具链扩展在Terminal-Bench 2.1上达到95.3%的原始准确率,或实现15美元的前沿运行

Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang

专题命中 工具调用 :agent(abstract,comments);分类 cs.AI

AI总结 本研究提出智能体原生运行时StateM,通过工具链扩展优化智能体执行系统,在Terminal-Bench 2.1等基准上显著提升GPT-5.6、DeepSeek-V4 Flash等模型的任务准确率,大幅降低运行成本,验证了其有效性与泛化性。

Comments Harness Scaling, Semi-Self-Evolving Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18727 2026-08-20 cs.LG cs.IR 新提交 57%

Visual-Aware Representation of Web Pages for Machine Learning Applications

面向机器学习应用的网页视觉感知表示

Radek Burget, Radek Hranický

机构 * Brno University of Technology(布尔诺理工大学) Faculty of Information Technology(信息技术学院)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 本文提出基于FitLayout的网页视觉感知表示与机器学习平台,支持数据集准备、机器学习输入获取,可用于训练图神经网络识别网页关键内容元素,保障结果可复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17499 2026-08-19 cs.AI 新提交 57%

Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context

面向更好的多轮用户交互智能体:下一轮用户输入不止是上下文

Yiwen Zhao, Zhihao Wen, Yuchen Mao, Mingxuan Jiang, Yihao Hu, Pan Wang, Xin Zhang, Wei Wu

机构 * Fudan University(复旦大学) Ant International, Ant Group(蚂蚁集团蚂蚁国际)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 该研究针对多轮用户交互智能体的信用分配问题,提出FACA方法,在多领域测试中提升了8B和14B规模模型的性能,验证了下一轮用户反应可提供局部信用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16544 2026-08-18 cs.MA cs.AI 新提交 57%

VCE-Skill: Enhancing Skill Self-Evolution with Version-Change Experience

VCE-Skill:利用版本变更经验增强技能自进化

Jianming Chen, Xuanbin Ye, Yawen Wang, Junjie Wang, Qing Wang, Fanjiang XU

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 本文提出VCE-Skill,将公共技能变更提炼为结构化版本变更经验并与轨迹提议自适应融合,提升了技能自进化的平均分数,增强了跨模型迁移性能,拓展了技能自进化的先验知识来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16502 2026-08-18 cs.LG cs.IR 新提交 57%

When Tool-Backed Skill Retrieval Fails: Source-Style Collapse in Executable Capability Retrieval

当工具支持的技能检索失效时:可执行能力检索中的源风格崩溃

Yiqi Liu, Joseph James, Yang Wang, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) University of Sheffield(谢菲尔德大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 该研究针对可执行能力检索中出现的源风格崩溃问题,提出源感知路由方法ToolScout,利用TF-IDF指纹提升检索覆盖率,验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16391 2026-08-18 cs.CR cs.AI 新提交 57%

Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs

Ventor-QTest:威胁模型驱动的供应商托管大语言模型API验证

Xiangfan Wu, Zonghao Ying, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 Ventor-QTest是一种无需目标API概率信息的复合黑盒审计方法,通过AFL和EFL指标审计供应商托管LLM API质量,可反映长视野任务的极端保真度损失,开源实现可获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15909 2026-08-18 cs.IR cs.CL 新提交 57%

Large language model-assisted discovery of cohorts from scientific literature

大语言模型辅助的科学文献队列发现

Moritz Sturm, Lisa M. Berg, Inken Berg, Harishny Sarma, Jasmin Hartmann, Denissa Girschik, Gemma Roig, Christine M. Freitag, Andreas G. Chiocchetti

专题命中 工具调用 :planning(abstract);分类 cs.CL

AI总结 该研究开发了问题驱动框架,通过PubMed API检索文献,用大语言模型提取队列名称,在青少年攻击行为遗传学用例中,补充了队列目录未覆盖的17个合格队列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15432 2026-08-18 cs.AI 新提交 57%

Does the Proof Prove It That Way? Faithful Formalization of Elements Proofs

证明是否以其应有的方式被证明?《几何原本》元素证明的忠实形式化

Tadd Mao, Tianjun Zhong, Dhruva Arekar, Yuming Feng, One An, Jiani Huang, Xujie Si, Ziyang Li

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 本研究提出满足五项必要条件的Pistis智能体式证明搜索方法,通过OrderDecompose分治搜索生成欧几里得《几何原本》前三卷的忠实形式化Lean证明,其性能优于基线方法,可作为证明检查工具。

Comments Preprint. 18 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14590 2026-08-18 cs.AI 新提交 57%

Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement

面向安全的大语言模型智能体:规范、验证与执行的综述

Pierre Dantas, Lucas Cordeiro, Ehsan Nowroozi, Tihanyi Norbert

机构 * The University of Manchester(曼彻斯特大学) The University of Greenwich(格林威治大学) Technology Innovation Institute(技术创新研究院)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14580 2026-08-18 cs.AI cs.IR 新提交 57%

OGX: An Open-Source, Vendor-Neutral Generative AI Application Server

OGX:开源、厂商中立的生成式AI应用服务器

Francisco Javier Arceo, Sébastien Han, Matthew Farrellee, Charlie Doern, Yuan Tang, Derek Higgins, Varsha Prasad Narsing, Gordon Sim, Sumanth Kamenani, Ben Browning, Raghotham Murthy

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 OGX是开源厂商中立的生成式AI应用服务器,支持主流实验室API与多后端,为多款AI开发者工具提供模型无关自托管后端,获超8400 GitHub星标

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14114 2026-08-17 cs.LG 新提交 57%

Learning to Run Power Networks: Effective AlphaZero-inspired Topological Control

学习运行电力网络:受AlphaZero启发的有效拓扑控制方法

Lukas Zetto, Benjamin Schäfer, Qiong Huang

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 针对电网拓扑控制的组合空间与约束问题,研究受AlphaZero启发的模型方法,发现优化的AlphaZero达98.43%生存能力,需结合领域启发式、二元奖励与受限观测空间。

Comments 10 pages, 9 figures. Accepted for publication in ACM SIGENERGY Energy Informatics Review, Volume 6, Issue 3, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13959 2026-08-17 cs.CL 新提交 57%

Repair, Not Improvement: Decomposing Constrained Decoding in Tool-Call Abstention

修复,而非改进:分解工具调用弃权中的约束解码

Janghoon Lee

机构 * Redrob

专题命中 工具调用 :function calling(abstract);分类 cs.CL

AI总结 该研究针对工具调用弃权问题,分解约束解码的作用,发现修复格式约束的效果优于改进,且两项预注册语言声明不成立。

Comments 24 pages, 4 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13221 2026-08-14 cs.AI 新提交 57%

TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

TsuGO:通过围棋死活问题探究大语言模型推理中的搜索效率

Shunwen Bai, Ziping Ma, Chaoyang Zhang, Yarong Wang, Jiale Liu, Zhen Qin, Qingpei Guo

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本研究提出围棋死活问题基准TsuGO,发现现有LLM的推理搜索组织能力远逊于神经引导的KataGo,指出搜索组织是LLM推理评估的缺失维度。

Comments 23 pages, 12 figures, 20 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏