arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-13 至 2026-01-13 共收录 177 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 14 篇

2510.00023 2026-01-13 cs.AI 89%

ToolBrain: A Flexible Reinforcement Learning Framework for Agentic Tools

ToolBrain: 一种灵活的强化学习框架用于智能工具

Quy Minh Le, Minh Sao Khue Luu, Khanh-Tung Tran, Duc-Hai Nguyen, Hoang-Quoc-Viet Pham, Quan Le, Hoang Thanh Lam, Hoang D. Nguyen

机构 * ToolBrain Research(ToolBrain研究机构) University College Cork(大学学院科克) CeADAR University College Dublin(CeADAR大学学院都柏林) IBM Research Lab(IBM研究实验室)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 ToolBrain通过灵活的强化学习框架提升智能代理的工具使用能力,支持多种训练策略并提供高效微调和推理功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07264 2026-01-13 cs.CL 87%

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents

置信二元性:分析和缓解工具使用代理中的校准偏差

Weihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 本研究提出强化学习框架,通过优化任务准确性和校准,缓解工具使用代理中的校准偏差,提升其在不同领域和环境中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04566 2026-01-13 cs.AI cs.CL 87%

BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents

BackdoorAgent: 一个统一框架用于针对基于LLM的代理的后门攻击

Yunhao Feng, Yige Li, Yutao Wu, Yingshui Tan, Yanming Guo, Yifan Ding, Kun Zhai, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡管理大学) Alibaba Group(阿里巴巴集团) Deakin University(德肯大学) Hunan Institute of Advanced Technology(湖南高级技术研究所)

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);planning(abstract)

AI总结 BackdoorAgent提出一个统一框架,分析LLM代理中后门攻击的跨阶段传播和触发器持续性,揭示代理工作流的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07072 2026-01-13 cs.CR cs.AI 81%

Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems

突破检索障碍:为LLM系统设计的野外间接提示注入

Hongyan Chang, Ergute Bao, Xinjian Luo, Ting Yu

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本研究提出了一种高效且低成本的黑盒攻击算法,通过分解恶意内容为触发片段和攻击片段,实现了对LLM系统的间接提示注入攻击,揭示了检索过程中存在的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07296 2026-01-13 cs.AI cs.CL 81%

LRAS: Advanced Legal Reasoning with Agentic Search

LRAS: 基于代理搜索的先进法律推理

Yujin Zhou, Chuxue Cao, Jinluan Yang, Lijun Wu, Conghui He, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 LRAS通过整合反思模仿学习和难度感知强化学习,使大推理模型能够识别知识边界并处理法律推理的复杂性,从而在法律领域取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 81%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 工具调用 :function calling(title,abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07107 2026-01-13 cs.CV cs.AI 70%

MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning

MEDVISTAGYM:一种通过工具集成强化学习进行医学图像思考的可扩展训练环境

Meng Lu, Yuxing Lu, Yuchen Zhuang, Megan Mullins, Yang Xie, Guanghua Xiao, Charles Fleming, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) UT Southwestern Medical Center(德克萨斯大学西南医学中心) Georgia Institute of Technology(佐治亚理工学院) Cisco(思科公司)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 MedVistaGym通过工具集成强化学习提升医学图像分析的代理训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07580 2026-01-13 physics.ins-det cs.AI cs.LG hep-ex 62%

Large Language Models for Physics Instrument Design

大型语言模型在物理仪器设计中的应用

Sara Zoccheddu, Shah Rukh Qasim, Patrick Owen, Nicola Serra

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大型语言模型在物理仪器设计中的应用,发现其能生成有效且物理合理的配置,尽管未进行特定任务训练,并提出将LLMs与强化学习结合以优化设计工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06604 2026-01-13 cs.AI cs.LG cs.RO 62%

Object-Centric World Models Meet Monte Carlo Tree Search

以对象为中心的世界模型与蒙特卡洛树搜索

Rodion Vakhitov, Leonid Ugadiarov, Aleksandr Panov

机构 * MIPT Moscow(莫斯科米斯托夫物理技术学院) AIRI(人工智能研究所) FRC CSC RAS(俄罗斯科学院计算机科学与应用数学研究所)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ObjectZero算法,通过对象中心表示和图神经网络,结合蒙特卡洛树搜索实现更有效的环境建模与强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06301 2026-01-13 cs.CR cs.AI cs.SE 62%

Beyond BeautifulSoup: Benchmarking LLM-Powered Web Scraping for Everyday Users

超越BeautifulSoup:为日常用户评估基于LLM的网络爬虫基准测试

Arth Bhardwaj, Nirav Diwan, Gang Wang

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.SE

AI总结 本文评估了基于LLM的网络爬虫在日常用户中的应用,展示了端到端LLM代理如何使复杂爬虫变得简单,同时比较了LLM辅助脚本和端到端代理在不同场景下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07732 2026-01-13 math.GR 50%

Semisimple algebraic groups over real closed fields

实闭域上的半单代数群

Raphael Appenzeller

专题命中 工具调用 :tool use(abstract)

AI总结 本文研究实闭域上半单代数群的性质,推广了半单李群的结果,证明了相关分解定理和Jacobson-Morozov引理,并利用模型论原理进行分析。

Comments Comments welcome! 47 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07297 2026-01-13 astro-ph.GA 50%

WISE/CatWISE Constraints on Dysonian Waste-Heat Technosignatures in Nearby Galaxies

使用WISE/CatWISE对附近星系中的Dyson型废热技术特征进行约束

Bo-Lun Huang, Zhen-Zhao Tao, Tong-Jie Zhang

专题命中 工具调用 :agent(abstract)

AI总结 研究利用WISE/CatWISE数据约束附近星系中Dyson型废热的存在,通过中红外波段分析得出废热上限,并探讨不同温度下的敏感度和限制。

Comments 18 pages, 12 figures, 2 tables. Accepted for publication in The Astronomical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06405 2026-01-13 econ.TH 50%

Bounded Rationality with Subjective Evaluations in Enlivened but Truncated Decision Trees

具有主观评估的受限制决策树中的有限理性

Peter J. Hammond

专题命中 工具调用 :agent(abstract)

AI总结 本文提出了一种基于主观评估的有限理性决策树模型,用于解释在受限制条件下决策过程中的理性行为。

Comments Full pre-publication version of working paper. It has been submitted for publication with its Sections 4 and 5 omitted. 64 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25602 2026-01-13 cs.IR 50%

TRUE: A Reproducible Framework for LLM-Driven Relevance Judgment in Information Retrieval

TRUE: 一种用于信息检索中基于大语言模型的相关性判断的可重复框架

Mouly Dewan, Jiqun Liu, Chirag Shah

专题命中 工具调用 :workflow(abstract)

AI总结 TRUE是一种用于信息检索中基于大语言模型的相关性判断的可重复框架,通过迭代数据采样和推理评估多个相关性因素,提升相关性判断的可靠性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 64 篇

2601.07577 2026-01-13 cs.AI 85%

Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents

超越纠缠规划:面向长时间 horizon 的任务解耦规划

Yunfan Li, Bingbing Xu, Xueyun Tian, Xiucheng Xu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室、计算技术研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出任务解耦规划(TDP)方法,通过将任务分解为子目标图,减少长horizon智能体的规划误差传播,提升鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11890 2026-01-13 cs.RO cs.AI 85%

Integrating Symbolic RL Planning into a BDI-based Autonomous UAV Framework: System Integration and SIL Validation

将符号RL规划整合到基于BDI的自主无人机框架中:系统集成与SIL验证

Sangwoo Jeon, Juchul Shin, YeonJe Cho, Gyeong-Tae Kim, Seongwoo Kim

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出AMAD-SRL框架,整合符号RL与BDI方法,通过SIL验证提升无人机任务效率75%。

Comments This submission has been withdrawn by the authors due to institutional and contractual requirements related to security and export-control review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07782 2026-01-13 cs.CL cs.AI cs.IR 84%

Beyond Single-Shot: Multi-step Tool Retrieval via Query Planning

超越单次检索:通过查询规划实现多步工具检索

Wei Fang, James Glass

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划决策 :planning(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出TOOLQP框架,通过迭代查询规划解决多步工具检索问题,实现更高效的检索和执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06064 2026-01-13 cs.CY cs.AI cs.MA 84%

Socio-technical aspects of Agentic AI

群体技术视角下的代理AI

Praveen Kumar Donta, Alaa Saleh, Ying Li, Shubham Vaishnav, Kai Fang, Hailin Feng, Yuchao Xia, Thippa Reddy Gadekallu, Qiyang Zhang, Xiaodan Shi, Ali Beikmohammadi, Sindri Magnússon, Ilir Murturi, Chinmaya Kumar Dehury, Marcin Paprzycki, Lauri Loven, Sasu Tarkoma, Schahram Dustdar

机构 * Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系) Center for Ubiquitous Computing, University of Oulu(奥卢大学无处不在计算中心) College of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Zhejiang A\&F University, Hangzhou(浙江工业大学之江学院) School of Computer Science, Peking University(北京大学计算机科学学院) Department of Mechatronics, University of Prishtina(普里什蒂纳大学机电系) Department of Computer Science, IISER Berhampur(伯尔哈普尔IISER计算机科学系) Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) Department of Computer Science, University of Helsinki(赫尔辛基大学计算机科学系)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文从社会技术视角探讨代理AI,分析其技术组件与社会背景的关联,揭示伦理挑战及未来研究方向。

Comments Dear Reviewer, please note that this is not survey/review or position paper. This paper introduced new framework (MAD-BAD-SAD Framework) for Socio-technical aspects of Agentic AI, Ethical considerations, which is very important to consider beside technical development

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07342 2026-01-13 cs.AI 83%

Agentic Diagnostic Reasoning over Telecom and Datacenter Infrastructure

基于电信和数据中心基础设施的代理诊断推理

Nicolas Tacheny

机构 * Ni2 Innovation Lab(Ni2创新实验室)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于代理的诊断框架,利用LLM通过MCP协议自主导航基础设施模型,实现故障诊断与影响发现,为自主事件解决和风险预测提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07232 2026-01-13 cs.AI 83%

Yes FLoReNce, I Will Do Better Next Time! Agentic Feedback Reasoning for Humorous Meme Detection

是的,Florne,我下次会做得更好!用于幽默表情包检测的代理反馈推理

Olivia Shanhong Liu, Pai Chet Ng, De Wen Soh, Konstantinos N. Plataniotis

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 Florne通过闭环反馈机制提升表情包幽默检测的适应性和解释质量。

Comments LaMAS@AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06373 2026-01-13 cs.MA 82%

DemMA: Dementia Multi-Turn Dialogue Agent with Expert-Guided Reasoning and Action Simulation

DemMA:具有专家引导推理和行动模拟的痴呆多轮对话代理

Yutong Song, Jiang Wu, Kazi Sharif, Honghui Xu, Nikil Dutt, Amir Rahmani

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract)

AI总结 DemMA通过专家引导的推理和行动模拟,实现了高保真的痴呆症患者多轮对话模拟,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06102 2026-01-13 cs.AI cs.LG 82%

Dynamic Intelligence Ceilings: Measuring Long-Horizon Limits of Planning and Creativity in Artificial Systems

动态智能上限:测量人工智能系统长期规划和创造力的长期限制

Truong Xuan Khanh, Truong Quynh Hoa

机构 * H&K Research Studio, Clevix LLC(Clevix LLC 研究室)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态智能上限概念,通过轨迹导向评估框架量化人工智能系统长期规划与创造力的限制,揭示智能上限的动态性与轨迹依赖性。

Comments This paper introduces a trajectory-centric evaluation framework for analyzing long-horizon intelligence limits in artificial systems, focusing on developmental behavior, planning, and structural creativity rather than proposing new learning algorithms. 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06818 2026-01-13 cs.CL 81%

AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents

AgentHallu: 评估基于大语言模型的代理的自动幻觉归因

Xuannan Liu, Xiao Yang, Zekun Li, Peipei Li, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Department of Computer Science & Technology, Tsinghua University(清华大学计算机科学与技术系) University of California, Santa Barbara(加州大学圣芭芭拉分校) Center for Research on Intelligent Perception and Computing, NLPR, CASIA(智能感知与计算研究中心,国家工程实验室)

专题命中 规划决策 :agent(abstract);tool-use(abstract);planning(abstract);agentic(abstract)

AI总结 AgentHallu提出一个评估基于大语言模型的代理自动识别幻觉来源的任务,通过高质量轨迹和多级注释评估13个模型,发现顶级模型在定位幻觉步骤上表现有限,工具使用幻觉最难识别。

Comments Project page: https://liuxuannan.github.io/AgentHallu.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08521 2026-01-13 cs.AI 81%

FlowSearch: Advancing deep research with dynamic structured knowledge flow

FlowSearch: 通过动态结构化知识流推进深度研究

Yusong Hu, Runmin Ma, Yue Fan, Jinxin Shi, Zongsheng Cao, Yuhao Zhou, Jiakang Yuan, Shuaiyu Zhang, Shiyang Feng, Xiangchao Yan, Shufei Zhang, Wenlong Zhang, Lei Bai, Bo Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 FlowSearch通过动态结构化知识流提升多智能体系统在复杂任务中的推理与执行能力,实现跨学科研究的有效推进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06164 2026-01-13 cs.SE cs.AI 81%

Contract2Plan: Verified Contract-Grounded Retrieval-Augmented Optimization for BOM-Aware Procurement and Multi-Echelon Inventory Planning

Contract2Plan: 一种基于合同的验证性检索增强优化方法用于BOM感知采购和多层级库存规划

Sahil Agarwal

机构 * Independent Researcher(独立研究者)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.SE

AI总结 Contract2Plan通过验证性检索增强优化方法,解决合同条款与BOM耦合导致的采购和库存规划问题,确保计划的可行性与合规性。

Comments 22 pages, 5 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06054 2026-01-13 cs.CL cs.AI 81%

A Multi-Stage Workflow for the Review of Marketing Content with Reasoning Large Language Models

一种基于推理大语言模型的多阶段营销内容审查工作流程

Alberto Purpura, Emily Chen, Swapnil Shinde

机构 * AI Foundations, Capital One(人工智能基础,Capital One)

专题命中 规划决策 :workflow(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种基于推理大语言模型的多阶段工作流程,用于自动审查营销内容的合规性,并评估不同微调策略和奖励函数对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12626 2026-01-13 cs.AI cs.DC 80%

Automated Planning for Optimal Data Pipeline Instantiation

最优数据管道实例化的自动化规划

Leonardo Rosa Amado, Adriano Vogel, Dalvan Griebler, Gabriel Paludo Licks, Eric Simon, Felipe Meneguzzi

机构 * Pontifical Catholic University of Rio Grande do Sul, Brazil(里约格朗德杜斯鲁斯天主教大学) Johannes Kepler University Linz, Austria(林茨约翰·凯撒大学) Sapienza University of Rome, Italy(罗马萨皮恩扎大学) SAP Labs, France(SAP实验室) University of Aberdeen, Scotland(阿伯丁大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于动作成本的规划方法,用于优化数据管道实例化,通过启发式算法减少总执行时间,并在实验中验证了其有效性。

Journal ref Proceedings of the ECAI Workshop on AI-based Planning for Complex Real-World Applications (CAIPI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07597 2026-01-13 cs.NE cs.AI 79%

Pheromone-Focused Ant Colony Optimization algorithm for path planning

基于信息素聚焦的蚁群优化算法用于路径规划

Yi Liu, Hongda Zhang, Zhongxue Gan, Yuning Chen, Ziqing Zhou, Chunlei Meng, Chun Ouyang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出基于信息素聚焦的蚁群优化算法,通过三种策略提升路径规划中的收敛速度和解质量。

Comments Accepted to 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14656 2026-01-13 cs.AI 79%

Cost-Awareness in Tree-Search LLM Planning: A Systematic Study

树搜索LLM规划中的成本意识:系统研究

Zihao Zhang, Hui Wei, Kenan Jiang, Shijia Pan, Shu Kai, Fei Liu

机构 * Emory University(埃默里大学) University of California, Merced(加州大学默塞德分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文研究了树搜索LLM规划器在资源受限下的成本意识问题,发现现有方法难以找到最优计划,双向搜索表现最佳,MCTS在短时间任务中最优,表明需新算法而非单纯增加计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06562 2026-01-13 cs.LG 79%

Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming

Mosaic: 通过全局内存规划和动态峰值镇压解锁扩散语言模型的长上下文推理

Liang Zheng, Bowen Shi, Yitao Hu, Jiawei Zhang, Ruofan Li, Sheng Chen, Wenxin Li, Keqiu Li

机构 * Tianjin University, China(天津大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 Mosaic通过全局内存规划和动态峰值镇压,提升扩散语言模型的长上下文推理能力,实现内存效率和推理长度的显著提升。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏