arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5118 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5118 篇

cs/0610170 2009-12-01 cs.LG cs.AI 62%

Low-complexity modular policies: learning to play Pac-Man and a new framework beyond MDPs

Istvan Szita, Andras Lorincz

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15089 2026-08-18 cs.AI 新提交 61%

StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

StateM:通过工具链扩展在Terminal-Bench 2.1上达到95.3%的原始准确率,或实现15美元的前沿运行

Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang

专题命中 工具调用 :agent(abstract,comments);分类 cs.AI

AI总结 本研究提出智能体原生运行时StateM,通过工具链扩展优化智能体执行系统,在Terminal-Bench 2.1等基准上显著提升GPT-5.6、DeepSeek-V4 Flash等模型的任务准确率,大幅降低运行成本,验证了其有效性与泛化性。

Comments Harness Scaling, Semi-Self-Evolving Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07872 2026-04-10 cs.NE cs.AI 61%

PyVRP$^+$: LLM-Driven Metacognitive Heuristic Evolution for Hybrid Genetic Search in Vehicle Routing Problems

PyVRP$^+$:基于LLM的元认知启发式进化方法用于车辆路径问题中的混合遗传搜索

Manuj Malik, Jianan Zhou, Shashank Reddy Chirra, Zhiguang Cao

机构 * Singapore Management University(新加坡管理大学) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI;autonomous agent(comments)

AI总结 本文提出PyVRP$^+$,通过LLM驱动的元认知启发式进化方法改进混合遗传搜索算法,发现更高效的启发式策略,提升VRP问题的求解性能。

Comments 18 pages, accepted to the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17675 2026-02-23 cs.DC cs.AI 61%

Mind the Boundary: Stabilizing Gemini Enterprise A2A via a Cloud Run Hub Across Projects and Accounts

注意边界:通过跨项目和账户的云运行枢纽稳定Gemini Enterprise A2A

Takao Morita

机构 * Independent Researcher(独立研究者)

专题命中 工具调用 :agent(abstract,comments);分类 cs.AI

AI总结 通过跨项目和账户的云运行枢纽稳定Gemini Enterprise A2A,解决边界依赖认证和UI兼容性问题,实现可靠路由和稳定响应。

Comments 7 pages. Implementation and evaluation study of cross-boundary agent orchestration for Gemini Enterprise UI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10796 2025-02-25 cs.RO cs.AI 61%

Heuristic Search for Path Finding with Refuelling

Shizhe Zhao, Anushtup Nandy, Howie Choset, Sivakumar Rathinam, Zhongqiang Ren

专题命中 工具调用 :planning(abstract,comments);分类 cs.AI

Comments 8 pages, 6 figures, RA-L 2025 submission, Motion and Path Path Planning, Scheduling and Coordination, Robotics in Under-Resourced Settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04019 2023-06-08 cs.AI 61%

Learning Search-Space Specific Heuristics Using Neural Networks

Yu Liu, Ryo Kuroiwa, Alex Fukunaga

专题命中 工具调用 :planning(abstract,comments);分类 cs.AI

Comments Proceedings of ICAPS Workshop on Heuristics and Search for Domain-independent Planning (HSDIP) 2020, pp.1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.03254 2017-11-13 cs.AI cs.DC 61%

On Hash-Based Work Distribution Methods for Parallel Best-First Search

Yuu Jinnai, Alex Fukunaga

专题命中 工具调用 :planning(abstract,comments);分类 cs.AI

Comments Source code of domain-specific solvers in multicore environment: https://github.com/jinnaiyuu/Parallel-Best-First-Searches Source code of classical planning in distributed environment: https://github.com/jinnaiyuu/distributed-fast-downward

Journal ref Yuu Jinnai and Alex Fukunaga. (2017). On Hash-Based Work Distribution Methods for Parallel Best-First Search. Journal of Artificial Intelligence Research (JAIR), 60, 491-548

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12589 2023-09-25 cs.RO 60%

A Multi-Robot Task Assignment Framework for Search and Rescue with Heterogeneous Teams

Hamid Osooli, Paul Robinette, Kshitij Jerath, S. Reza Ahmadzadeh

专题命中 工具调用 :planning(abstract);agent(comments);multi-agent(comments)

Comments The 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023 Advances in Multi-Agent Learning - Coordination, Perception, and Control Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24912 2026-08-27 cs.HC cs.AI 新提交 57%

Analyzing and Correcting Benevolence Bias in Large Language Models

分析与修正大语言模型中的善意偏差

Yuanzi Li, Junhao Wang, Minghui Liu, Boyi Li, Bingchen Chen, Zihang Tian, Jingyu Zhao, Yuhan Wang, Lei Wang, Pei Wang, Jinchao Wu, Xu Chen

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本研究识别出大语言模型存在的善意偏差,发现其稳定且随模型规模增大而增强,提出轻量对比校准法可修正该偏差,明确了对齐后的大语言模型作为人类替代者的适用场景与修正方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17889 2026-08-27 cs.IR cs.AI cs.CV 交叉投稿 57%

VisDocAgentBench: Benchmarking Agents for Visually Rich Document Retrieval

VisDocAgentBench:面向视觉丰富文档检索的智能体基准测试

Lexiang Hu, Yanzhao Zhang, Mingxin Li, Dingkun Long, Yikang Li, Fuwei Zhang, Yisen Wang, Zhouchen Lin

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 该研究提出VisDocAgentBench基准,对比静态与智能体检索,发现视觉检索优于OCR文本检索,智能体可改善双桥项检索性能,为检索智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24777 2026-08-26 cs.AI cs.CR 新提交 57%

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏

Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Fudan University(复旦大学) Renmin University of China(中国人民大学) KAUST(阿卜杜拉国王科技大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。

Comments Accepted by EMNLP 2026. Project page: https://zheng977.github.io/StepGuard/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24545 2026-08-26 cs.AI 新提交 57%

Discovering Adaptive Transmission Programs for Collective Innovation

面向集体创新的自适应传输程序发现

Cédric Colas, Jérémy Perez, Eleni Nisioti, Akhilesh Mocherla, Pierre-Yves Oudeyer, Clément Moulin-Frier, Maxime Derex

机构 * Flowers AI & CogSci Lab(Flowers AI与认知科学实验室) Inria(法国国家信息与自动化研究所) IT University of Copenhagen(哥本哈根IT大学) Institute for Advanced Study in Toulouse(图卢兹高等研究院)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究针对集体创新任务,提出用LLM引导的进化搜索设计基于状态感知的传输协议,使集体性能较基准提升37%,协议可跨领域与群体迁移,为AI辅助设计协调基础设施提供了路径。

Comments CogSci 2026; longer version in prep

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24302 2026-08-26 cs.AI 新提交 57%

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法

Guoyang Xu, Hao Chen

机构 * Tencent(腾讯)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24060 2026-08-26 cs.IR cs.CL cs.DB 新提交 57%

SQLite is Enough. Lexical, Semantic, and Hybrid Search with scrydb

SQLite 就足够了:使用 scrydb 的词汇、语义及混合搜索

Timo Breuer

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 本研究推出 Python 库 scrydb,基于 SQLite 的 FTS5 和 sqlite-vec 扩展实现词汇、语义及混合搜索,经 IR 基准数据集验证,可为信息检索或智能体搜索下游任务提供轻量高效的解决方案。

Comments Software available at https://github.com/breuert/scrydb

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24053 2026-08-26 cs.CV cs.CL cs.IR 新提交 57%

WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

WeMM-Embedding:微信多模态嵌入技术报告

Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao, Jing Lyu

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部)

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 本报告提出WeMM-Embedding多模态嵌入模型家族,含2B、4B、9B变体,经两阶段训练后在公开基准及微信应用中表现优异,已部署并开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-26 cs.AI 新提交 57%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22762 2026-08-25 cs.AI 新提交 57%

Compositional Chain-of-Relations for Faithful Knowledge Graph Question Answering with Large Language Models

面向大型语言模型的忠实知识图谱问答的组合式关系链

Chenhui Liu, Jianpeng Zhou, Jiahai Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文针对现有基于LLM的KGQA方法存在的实体剪枝不可靠、约束处理无基础的局限,提出组合式关系链(CCoR)框架,以关系为中心探索实现更忠实的多跳KGQA,在多个基准上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22708 2026-08-25 cs.AI 新提交 57%

CacheRouter: A Dual-Path Tool Routing Architecture with Cache-Preserving Main-Model Isolation for Long-Tail Tool Discovery

CacheRouter:一种用于长尾工具发现的保留缓存的主模型隔离双路径工具路由架构

Donghui Zha, Lingwei Xu, Linxiao Wu, Yixue Dong, Haochen Li

机构 * School of Mathematical Sciences, Beijing University of Posts and Telecommunications(北京邮电大学数学科学学院) School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) School of Science, Beijing Forestry University(北京林业大学理学院)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 针对LLM工具使用中渐进式披露与提示词缓存的权衡,提出CacheRouter双路径路由架构,通过主模型隔离与工具路由通道设计提升缓存命中率,降低输入成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22429 2026-08-25 cs.AI 新提交 57%

Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding

基于结构化接地的思考:面向图表与视觉表格理解的感知强化学习

Changjiang Jiang, Qiannian Zhao, Lei Xin, Jinxiang Xie, Preslav Nakov, Zhuohan Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Nanjing University(南京大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 针对MLLMs依赖外部工具感知图表等视觉内容的问题,提出TwSG框架,通过两阶段训练实现细粒度视觉推理,降低延迟并提升准确率与鲁棒性。

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21555 2026-08-25 cs.PL cs.DS cs.LG 新提交 57%

Tensor Seeks Layout: Formalizing Layout Selection for ML Compilers

张量寻求布局:为机器学习编译器形式化布局选择

Clemens Eisenhofer, Yuwen Jia, Daniel Kroening, Sergey Pupyrev

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文首次形式化机器学习编译器的布局选择问题,提出组合优化模型与算法,实现多种现有策略的统一,在AI加速器编译器上的实验验证了其效果,可分离成本模型误差与搜索质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04384 2026-08-25 cs.AI 版本更新 57%

Improving Auto-Design of Neural PDE Solvers with a Domain-Specific Language

用领域特定语言改进神经偏微分方程求解器的自动设计

Shengxin Kong, Liwen Xu, Jingwen Fu

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08875 2026-08-25 cs.AI cs.SI physics.soc-ph 版本更新 57%

Online design of dynamic networks

动态网络的在线设计

Duo Wang, Andrea Araldo, Mounim El Yacoubi

机构 * Peking University(北京大学) Institut Polytechnique de Paris(巴黎理工学院)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出一种基于蒙特卡洛树搜索的滚动时间规划方法,用于动态网络的在线设计,通过实时调整公交线路以适应随机需求,提升系统性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21027 2026-08-24 cs.AI 新提交 57%

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

无需解决,仅需比较:用于LLM智能体运行时干预的微型顾问

Yanze Jiang, Mingxuan Li, Yuhao Wang, Shengfang Zhai, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体运行时干预需求,提出仅比较框架COTA,经多任务多执行器评估,其性能优于基线,可在辅助模型能力弱于执行器时实现有效干预。

Comments 21 pages, 1 figure, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11818 2026-08-24 cs.CV cs.AI 版本更新 57%

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents

MM-ToolSandBox:一个用于评估视觉工具调用智能体的统一框架

Kaixin Ma, Di Feng, Alexander Metz, Jiarui Lu, Eshan Verma, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 介绍MM-ToolSandBox框架,它能支持多图像、多轮任务,通过自动化管道生成场景。评估12个先进模型发现当前模型视觉工具调用能力不足,视觉精度是瓶颈,不同规模模型失败原因不同,该框架和基准已公开。

Comments Benchmark link: https://github.com/apple/ml-mmtoolsandbox

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-21 cs.SE 版本更新 57%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18727 2026-08-20 cs.LG cs.IR 新提交 57%

Visual-Aware Representation of Web Pages for Machine Learning Applications

面向机器学习应用的网页视觉感知表示

Radek Burget, Radek Hranický

机构 * Brno University of Technology(布尔诺理工大学) Faculty of Information Technology(信息技术学院)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 本文提出基于FitLayout的网页视觉感知表示与机器学习平台,支持数据集准备、机器学习输入获取,可用于训练图神经网络识别网页关键内容元素,保障结果可复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17499 2026-08-19 cs.AI 新提交 57%

Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context

面向更好的多轮用户交互智能体:下一轮用户输入不止是上下文

Yiwen Zhao, Zhihao Wen, Yuchen Mao, Mingxuan Jiang, Yihao Hu, Pan Wang, Xin Zhang, Wei Wu

机构 * Fudan University(复旦大学) Ant International, Ant Group(蚂蚁集团蚂蚁国际)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 该研究针对多轮用户交互智能体的信用分配问题,提出FACA方法,在多领域测试中提升了8B和14B规模模型的性能,验证了下一轮用户反应可提供局部信用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 57%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26703 2026-08-19 cond-mat.mtrl-sci cs.AI physics.comp-ph 版本更新 57%

Discovering physical mechanisms from experiment-simulation mismatches

可自我进化的代理用于DFT实验能带不匹配的可解释诊断

Yue Li, Penghui Yang, Yushan Xiao, Zhonghan Zhang, Jianguo Huang, Yuhao Lu, Cuntai Guan, Bo An, Bijun Tang, Zheng Liu

机构 * School of Materials Science and Engineering, Nanyang Technological University(南洋理工大学材料科学与工程学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出XDFT代理,通过自动诊断DFT计算中能带不匹配问题,利用贝叶斯后验更新假设有效性,有效识别78%的不匹配案例,优于随机基线和静态LLM排序。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14656 2026-08-19 stat.ML cs.LG 版本更新 57%

Inverse Problems for Partial Differential Equations with Jump Discontinuities in Coefficients via Two-Stage Physics-Informed Deep Learning and Statistical Mixture Models

基于两阶段物理信息深度学习和统计混合模型的系数具有跳跃不连续性的偏微分方程反问题

Zhikun Zhang, Guanyu Pan, Xiangjun Wang, Yong Xu, Guangtao Zhang

机构 * School of Mathematics and Statistics(数学与统计学学院) Northwestern Polytechnical University(西北工业大学) Huazhong University of Science and Technology(华中科技大学) Xiangtan University(湘潭大学) Southern University of Science and Technology(南方科技大学) MOE Key Laboratory for Complexity Science in Aerospace(航空航天复杂科学教育部重点实验室) SandGold AI Research(SandGold AI研究院)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 提出两阶段物理信息深度学习框架,结合神经网络采样与统计推断,解决系数具有跳跃不连续性的PDE反问题,实现参数识别与解重构。

详情

展开后加载摘要…

URL PDF HTML 收藏