arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-27 至 2026-01-27 共收录 172 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2510.25423 2026-01-27 cs.SE 90%

What Challenges Do Developers Face in AI Agent Systems? An Empirical Study on Stack Overflow & GitHub Issues

人工智能代理系统中开发者面临哪些挑战?对Stack Overflow和GitHub问题的实证研究

Ali Asgari, Annibale Panichella, Pouria Derakhshanfar, Mitchell Olsthoorn

专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);planning(abstract)

AI总结 本研究通过分析Stack Overflow和GitHub问题,识别出人工智能代理系统开发中的五大主要挑战,包括环境管理、检索与记忆、协调控制、交互契约及运行时可靠性。

Comments v2: Adds GitHub Issues analysis; expands dataset and taxonomy; updates results and discussion. (15 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18202 2026-01-27 cs.AI 83%

SAGE: Steerable Agentic Data Generation for Deep Search with Execution Feedback

SAGE: 用于深度搜索的可调节代理数据生成与执行反馈

Fangyuan Xu, Rujun Han, Yanfei Chen, Zifeng Wang, I-Hung Hsu, Jun Yan, Vishy Tirumalashetty, Eunsol Choi, Tomas Pfister, Chen-Yu Lee

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 SAGE通过生成高质量、难度可控的深度搜索问题-答案对,提升深度搜索代理的性能和适应性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24330 2026-01-27 cs.CV 82%

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

SenseNova-MARS: 通过强化学习赋能多模态代理推理与搜索

Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract)

AI总结 SenseNova-MARS通过强化学习赋能多模态代理推理与搜索,提升视觉-语言模型在复杂视觉任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17548 2026-01-27 cs.CR 78%

Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems

针对代理编码助手的提示注入攻击:对技能、工具和协议生态系统漏洞的系统分析

Narek Maloyan, Dmitry Namiot

专题命中 工具调用 :agentic(title,abstract)

AI总结 本文系统分析了代理编码助手的提示注入攻击漏洞,提出三维分类法并揭示防御不足,强调需架构级防护而非碎片化措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18207 2026-01-27 cs.LG cs.AI cs.CL cs.IR 75%

PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR

PaperSearchQA: 基于强化学习与验证奖励的学习科学论文搜索与推理

James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min Woo Sun, Emma Lundberg, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Chan Zuckerberg Biohub Network(查纳·泽克拜尔生物枢纽网络) KTH Royal Institute of Technology(皇家理工学院)

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 PaperSearchQA通过训练搜索代理在科学论文中进行搜索与推理,提升技术问答能力,为未来的人工智能科学家系统奠定基础。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11266 2026-01-27 cs.SE cs.AI 73%

Live API-Bench: 2500+ Live APIs for Testing Multi-Step Tool Calling

Benjamin Elder, Anupama Murthi, Jungkoo Kang, Ankita Rajaram Naik, Kiran Kate, Kinjal Basu, Danish Contractor

机构 * IBM Research AI(IBM人工智能研究实验室)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.SE

Comments 11+32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17829 2026-01-27 cs.CL cs.AI 62%

Linguistic and Argument Diversity in Synthetic Data for Function-Calling Agents

合成数据中语言和论证多样性用于功能调用代理

Dan Greenstein, Zohar Karnin, Chen Amiraz, Oren Somekh

机构 * Technion(技术学院) TII(技术研究所)

专题命中 工具调用 :function calling(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种生成合成数据集的方法,通过优化通用多样性度量标准,提高功能调用代理训练数据的语言和论证多样性,从而提升模型在分布外任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15058 2026-01-27 cs.CR cs.LG cs.SE 62%

LibLMFuzz: LLM-Augmented Fuzz Target Generation for Black-box Libraries

LibLMFuzz: 用于黑盒库的LLM增强模糊目标生成

Ian Hardgrove, John D. Hastings

机构 * The Beacom College of Computer and Cyber Sciences(计算机与网络科学学院) Dakota State University(达科他州立大学)

专题命中 工具调用 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 LibLMFuzz通过结合LLM和轻量级工具链,实现对闭源库的自动模糊测试,生成正确驱动程序并提高覆盖率。

Comments 6 pages, 2 figures, 1 table, 2 listings

Journal ref 2025 IEEE Cyber Awareness and Research Symposium (CARS'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17549 2026-01-27 cs.CR cs.AI 57%

Breaking the Protocol: Security Analysis of the Model Context Protocol Specification and Prompt Injection Vulnerabilities in Tool-Integrated LLM Agents

打破协议:模型上下文协议规范的安全分析及工具集成LLM代理中的提示注入漏洞

Narek Maloyan, Dmitry Namiot

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文分析了模型上下文协议的安全漏洞,提出MCPSec协议扩展以提升安全性,减少攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17231 2026-01-27 cs.RO cs.AR 50%

Real-Time, Energy-Efficient, Sampling-Based Optimal Control via FPGA Acceleration

基于FPGA加速的实时、节能的采样最优控制

Tanmay Desai, Brian Plancher, R. Iris Bahar

机构 * Colorado School of Mines(科罗拉多矿业学院) Barnard College(巴纳德学院) Columbia University(哥伦比亚大学) Dartmouth College(达特茅斯学院)

专题命中 工具调用 :planning(abstract)

AI总结 本文提出一种基于FPGA加速的MPPI控制方法,通过深度流水线和并行性优化,实现嵌入式平台上的高效能和低能耗控制。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 52 篇

2601.17346 2026-01-27 cs.AI 92%

Multi-Agent Learning Path Planning via LLMs

通过大型语言模型进行多智能体学习路径规划

Haoxin Xu, Changyong Qi, Tong Liu, Bohao Zhang, Anna He, Bingqian Jiang, Longwei Zheng, Xiaoqing Gu

机构 * Shanghai International Studies University(上海国际 Studies 大学) East China Normal University(华东师范大学) Huaiyin Normal University(淮阴师范学院) City University of Macau(澳门城市大学)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本研究提出基于LLMs的多智能体学习路径规划框架,通过角色与规则协作机制提升学习路径的透明性与可解释性,实验表明其在路径质量、知识一致性及认知负荷匹配方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18137 2026-01-27 cs.AI cs.CL 91%

DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints

DeepPlanning: 用可验证约束基准测试长周期代理规划

Yinger Zhang, Shutong Jiang, Renhao Li, Jianhong Tu, Yang Su, Lianghao Deng, Xudong Guo, Chenxu Lv, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划决策 :planning(title,abstract);agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 DeepPlanning是一个针对长周期代理规划的基准测试,通过多日旅行和多产品购物任务,评估代理在全局约束优化和局部约束推理中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04472 2026-01-27 cs.CL cs.AI 90%

RECAP: REwriting Conversations for Intent Understanding in Agentic Planning

RECAP:用于代理规划中意图理解的对话重写

Kushan Mitra, Dan Zhang, Hannah Kim, Estevam Hruschka

专题命中 规划决策 :planning(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 RECAP通过对话重写提升代理规划中的意图理解,提出新基准和方法,验证重写对规划效用的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17744 2026-01-27 cs.AI cs.CR cs.DC 89%

Faramesh: A Protocol-Agnostic Execution Control Plane for Autonomous Agent Systems

Faramesh:一种协议无关的自主代理系统执行控制平面

Amjad Fatmi

机构 * The Faramesh Labs(弗拉梅什实验室)

专题命中 规划决策 :agent(title,abstract);autonomous agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 Faramesh通过非可绕过的动作授权边界,实现自主代理系统执行时的强制授权和可预测治理。

Comments 40 pages, 10 figures. Preprint. Code: https://github.com/faramesh/faramesh-core

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17435 2026-01-27 cs.SE cs.AI 89%

Towards a Declarative Agentic Layer for Intelligent Agents in MCP-Based Server Ecosystems

迈向基于MCP服务器生态系统的声明性代理层

Maria Jesus Rodriguez-Sanchez, Manuel Noguera, Angel Ruiz-Zafra, Kawtar Benghazi

专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文提出了一种声明性代理层,旨在解决基于MCP服务器生态系统中代理工作流的可靠性问题,通过明确的架构结构提升任务执行的可验证性和可重复性。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17084 2026-01-27 physics.chem-ph cs.AI physics.comp-ph 87%

ChemNavigator: Agentic AI Discovery of Design Rules for Organic Photocatalysts

ChemNavigator: 基于代理AI的有机光催化剂设计规则发现

Iman Peivaste, Ahmed Makradi, Salim Belouettar

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学技术研究所) University of Luxembourg(卢森堡大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 ChemNavigator通过代理AI自主发现有机光催化剂设计规则,推导出六个化学基础设计原则,为AI辅助材料发现提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17566 2026-01-27 cs.CV 85%

Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning

Sponge Tool Attack:针对工具增强代理推理的隐蔽低效攻击

Qi Li, Xinchao Wang

专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 Sponge Tool Attack通过重写输入提示,隐蔽地破坏工具增强代理推理的效率,验证了其在多种模型和工具上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16984 2026-01-27 cs.LG cs.AI cs.CL cs.CV cs.IR cs.MM 85%

TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation

TelcoAI: 通过代理多模态检索增强生成技术推进3GPP技术规范搜索

Rahul Ghosh, Chun-Hao Liu, Gaurav Rele, Vidya Sagar Ravipati, Hazar Aouad

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(生成式AI创新中心,亚马逊网络服务)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 TelcoAI通过代理多模态检索增强生成技术,提升3GPP技术规范搜索的准确性和效率,实现87%的召回率和16%的性能提升。

Comments Accepted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17227 2026-01-27 cs.RO 82%

Hierarchical Informative Path Planning via Graph Guidance and Trajectory Optimization

基于图引导和轨迹优化的分层信息路径规划

Avraiem Iskandar, Shamak Dutta, Kevin Murrant, Yash Vardhan Pant, Stephen L. Smith

机构 * Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) National Research Council Canada(加拿大国家研究理事会)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 本文提出一种分层信息路径规划方法,结合图引导和轨迹优化,通过分段预算分配和样条细化,实现更低的后验不确定性与更快的运行速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18204 2026-01-27 cs.CL 79%

MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning

MemWeaver: 为可追溯的长 horizon 代理推理编织混合记忆

Juexiang Ye, Xue Li, Xinyu Yang, Chengkai Huang, Lanshun Nie, Lina Yao, Dechen Zhan

机构 * Harbin Institute of Technology(哈尔滨理工大学) The University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.CL

AI总结 MemWeaver通过编织混合记忆系统,提升长 horizon 代理推理的准确性与可追溯性,减少输入上下文长度

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02328 2026-01-27 cs.RO cs.LG 79%

Path Planning using a One-shot-sampling Skeleton Map

基于一次性采样骨架图的路径规划

Gabriel O. Flores-Aquino, Octavio Gutierrez-Frias, Juan Irving Vasquez

机构 * Centro de Investigación en Matematicas (CIMAT), A.C.(数学研究所(CIMAT)) Unidad Profesional Interdisciplinaria en Ingeniería y Tecnologías Avanzadas (UPIITA), Instituto Politécnico Nacional (IPN)(跨学科工程与先进技术单位(UPIITA),墨西哥理工学院(IPN)) Centro de Innovación y Desarrollo Tecnológico en Cómputo (CIDETEC), Instituto Politécnico Nacional (IPN)(计算创新与技术发展中心(CIDETEC),墨西哥理工学院(IPN))

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出基于SkelUnet的高效路径规划方法,通过一次性采样骨架图快速生成安全路径,提升导航效率和安全性。

Comments Submitted to IEEE Latin America Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18217 2026-01-27 cs.AI cs.LG 79%

Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents

支付更少的泛化税:RL训练对LLM代理跨域泛化能力的研究

Zhihan Liu, Lin Guan, Yixin Nie, Kai Zhang, Zhuoqun Hao, Lin Chen, Asli Celikyilmaz, Zhaoran Wang, Na Zhang

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR) Northwestern University(西北大学) The Ohio State University(俄亥俄州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了RL训练对LLM代理跨域泛化能力的影响,发现增加状态信息丰富度可提升泛化性能,同时指出建模选择对泛化能力的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18563 2026-01-27 cs.NI 78%

An LLM-Agent-Based Framework for Age of Information Optimization in Heterogeneous Random Access Networks

一种基于LLM代理的异构随机接入网络信息年龄优化框架

Fang Liu, Erchao Zhu, Jiedan Tan, Jingwen Tong, Taotao Wang, Shengli Zhang

专题命中 规划决策 :agent(title,abstract)

AI总结 本文提出Reflex-Core框架,通过LLM代理优化异构网络中的信息年龄,实现更高效的随机接入控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18386 2026-01-27 cs.CV 78%

ARMOR: Agentic Reasoning for Methods Orchestration and Reparameterization for Robust Adversarial Attacks

ARMOR: 为对抗攻击的鲁棒性进行方法编排与重参数化中的代理推理

Gabriel Lee Jun Rong, Christos Korgialas, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

专题命中 规划决策 :agentic(title,abstract)

AI总结 ARMOR通过视觉语言模型引导的代理协作,提升对抗攻击的鲁棒性和跨架构迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17833 2026-01-27 cs.CR 78%

An Effective and Cost-Efficient Agentic Framework for Ethereum Smart Contract Auditing

一种高效且成本效益高的以太坊智能合约审计代理框架

Xiaohui Hu, Wun Yu Chan, Yuejie Shi, Qumeng Sun, Wei-Cheng Wang, Chiachih Wu, Haoyu Wang, Ningyu He

专题命中 规划决策 :agentic(title);agent(abstract)

AI总结 本文提出Heimdallr,一种高效且低成本的智能合约审计代理,通过四个创新技术实现高精度检测,减少分析时间和成本,发现多个零日漏洞并保护大量资金。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17750 2026-01-27 math.OC cs.NA math.NA physics.med-ph 78%

Multi-Criteria Inverse Robustness in Radiotherapy Planning Using Semidefinite Programming

利用半正定规划的多准则逆鲁棒性在放射治疗计划中的应用

Jan Schröeder, Yair Censor, Philipp Süss, Karl-Heinz Küfer

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出利用半正定规划解决放射治疗计划中的多准则逆鲁棒性问题,通过建模不确定性并优化治疗计划的鲁棒性与体积。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11271 2026-01-27 physics.med-ph 78%

An AI dose engine for fast carbon ion treatment planning

一种用于快速碳离子治疗计划的AI剂量引擎

Anastasiia Quarz, Angelica De Gregorio, Gaia Franciosini, Angelo Schiavi, Zoltán Perkó, Lennart Volz, Christoph Hoog Antink, Vincenzo Patera, Marco Durante, Christian Graeff

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种基于AI的快速碳离子治疗剂量引擎,实现与MC模拟相当的精度,速度提升达400倍,支持在线自适应规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17008 2026-01-27 cs.LG 74%

Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs

Turn-PPO:基于PPO的回合级优势估计以提升代理语言模型中的多回合强化学习

Junbo Li, Peng Zhou, Rui Meng, Meet P. Vadera, Lihong Li, Yang Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 本研究提出turn-PPO,通过回合级MDP公式化提升多回合强化学习在代理语言模型中的表现,验证其在WebShop和Sokoban数据集上的有效性。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17699 2026-01-27 cs.AI cs.CL 73%

SQL-Trail: Multi-Turn Reinforcement Learning with Interleaved Feedback for Text-to-SQL

SQL-Trail: 多轮强化学习与交错反馈用于文本到SQL

Harper Hua, Zhen Han, Zhengyuan Shen, Jeremy Lee, Patrick Guan, Qi Zhu, Sullam Jeoung, Yueyan Chen, Yunfei Bai, Shuai Wang, Vassilis Ioannidis, Huzefa Rangwala

机构 * Stanford University(斯坦福大学) Amazon Web Services(亚马逊网络服务)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 SQL-Trail通过多轮强化学习与交错反馈提升文本到SQL的生成能力,实现更高效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17577 2026-01-27 cs.HC cs.AI cs.CL 73%

Status Hierarchies in Language Models

语言模型中的地位层级

Emilio Barkett

机构 * Brigham Young University–Hawaii COLUMBIA UNIVERSITY(哥伦比亚大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 语言模型在多智能体环境中会因地位线索形成层级,高地位分配反而降低高能力模型的服从,揭示AI系统中的新兴社会行为。

详情

展开后加载摘要…

URL PDF HTML 收藏