arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-13 至 2026-01-13 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 14 篇

2510.00023 2026-01-13 cs.AI 89%

ToolBrain: A Flexible Reinforcement Learning Framework for Agentic Tools

ToolBrain: 一种灵活的强化学习框架用于智能工具

Quy Minh Le, Minh Sao Khue Luu, Khanh-Tung Tran, Duc-Hai Nguyen, Hoang-Quoc-Viet Pham, Quan Le, Hoang Thanh Lam, Hoang D. Nguyen

机构 * ToolBrain Research(ToolBrain研究机构) University College Cork(大学学院科克) CeADAR University College Dublin(CeADAR大学学院都柏林) IBM Research Lab(IBM研究实验室)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 ToolBrain通过灵活的强化学习框架提升智能代理的工具使用能力,支持多种训练策略并提供高效微调和推理功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07264 2026-01-13 cs.CL 87%

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents

置信二元性:分析和缓解工具使用代理中的校准偏差

Weihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 本研究提出强化学习框架,通过优化任务准确性和校准,缓解工具使用代理中的校准偏差,提升其在不同领域和环境中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04566 2026-01-13 cs.AI cs.CL 87%

BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents

BackdoorAgent: 一个统一框架用于针对基于LLM的代理的后门攻击

Yunhao Feng, Yige Li, Yutao Wu, Yingshui Tan, Yanming Guo, Yifan Ding, Kun Zhai, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡管理大学) Alibaba Group(阿里巴巴集团) Deakin University(德肯大学) Hunan Institute of Advanced Technology(湖南高级技术研究所)

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);planning(abstract)

AI总结 BackdoorAgent提出一个统一框架,分析LLM代理中后门攻击的跨阶段传播和触发器持续性,揭示代理工作流的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07072 2026-01-13 cs.CR cs.AI 81%

Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems

突破检索障碍:为LLM系统设计的野外间接提示注入

Hongyan Chang, Ergute Bao, Xinjian Luo, Ting Yu

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本研究提出了一种高效且低成本的黑盒攻击算法,通过分解恶意内容为触发片段和攻击片段,实现了对LLM系统的间接提示注入攻击,揭示了检索过程中存在的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07296 2026-01-13 cs.AI cs.CL 81%

LRAS: Advanced Legal Reasoning with Agentic Search

LRAS: 基于代理搜索的先进法律推理

Yujin Zhou, Chuxue Cao, Jinluan Yang, Lijun Wu, Conghui He, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 LRAS通过整合反思模仿学习和难度感知强化学习,使大推理模型能够识别知识边界并处理法律推理的复杂性,从而在法律领域取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 81%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 工具调用 :function calling(title,abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07107 2026-01-13 cs.CV cs.AI 70%

MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning

MEDVISTAGYM:一种通过工具集成强化学习进行医学图像思考的可扩展训练环境

Meng Lu, Yuxing Lu, Yuchen Zhuang, Megan Mullins, Yang Xie, Guanghua Xiao, Charles Fleming, Wenqi Shi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) UT Southwestern Medical Center(德克萨斯大学西南医学中心) Georgia Institute of Technology(佐治亚理工学院) Cisco(思科公司)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 MedVistaGym通过工具集成强化学习提升医学图像分析的代理训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07580 2026-01-13 physics.ins-det cs.AI cs.LG hep-ex 62%

Large Language Models for Physics Instrument Design

大型语言模型在物理仪器设计中的应用

Sara Zoccheddu, Shah Rukh Qasim, Patrick Owen, Nicola Serra

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大型语言模型在物理仪器设计中的应用,发现其能生成有效且物理合理的配置,尽管未进行特定任务训练,并提出将LLMs与强化学习结合以优化设计工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06604 2026-01-13 cs.AI cs.LG cs.RO 62%

Object-Centric World Models Meet Monte Carlo Tree Search

以对象为中心的世界模型与蒙特卡洛树搜索

Rodion Vakhitov, Leonid Ugadiarov, Aleksandr Panov

机构 * MIPT Moscow(莫斯科米斯托夫物理技术学院) AIRI(人工智能研究所) FRC CSC RAS(俄罗斯科学院计算机科学与应用数学研究所)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ObjectZero算法,通过对象中心表示和图神经网络,结合蒙特卡洛树搜索实现更有效的环境建模与强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06301 2026-01-13 cs.CR cs.AI cs.SE 62%

Beyond BeautifulSoup: Benchmarking LLM-Powered Web Scraping for Everyday Users

超越BeautifulSoup:为日常用户评估基于LLM的网络爬虫基准测试

Arth Bhardwaj, Nirav Diwan, Gang Wang

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.SE

AI总结 本文评估了基于LLM的网络爬虫在日常用户中的应用,展示了端到端LLM代理如何使复杂爬虫变得简单,同时比较了LLM辅助脚本和端到端代理在不同场景下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07732 2026-01-13 math.GR 50%

Semisimple algebraic groups over real closed fields

实闭域上的半单代数群

Raphael Appenzeller

专题命中 工具调用 :tool use(abstract)

AI总结 本文研究实闭域上半单代数群的性质,推广了半单李群的结果,证明了相关分解定理和Jacobson-Morozov引理,并利用模型论原理进行分析。

Comments Comments welcome! 47 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07297 2026-01-13 astro-ph.GA 50%

WISE/CatWISE Constraints on Dysonian Waste-Heat Technosignatures in Nearby Galaxies

使用WISE/CatWISE对附近星系中的Dyson型废热技术特征进行约束

Bo-Lun Huang, Zhen-Zhao Tao, Tong-Jie Zhang

专题命中 工具调用 :agent(abstract)

AI总结 研究利用WISE/CatWISE数据约束附近星系中Dyson型废热的存在,通过中红外波段分析得出废热上限,并探讨不同温度下的敏感度和限制。

Comments 18 pages, 12 figures, 2 tables. Accepted for publication in The Astronomical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06405 2026-01-13 econ.TH 50%

Bounded Rationality with Subjective Evaluations in Enlivened but Truncated Decision Trees

具有主观评估的受限制决策树中的有限理性

Peter J. Hammond

专题命中 工具调用 :agent(abstract)

AI总结 本文提出了一种基于主观评估的有限理性决策树模型,用于解释在受限制条件下决策过程中的理性行为。

Comments Full pre-publication version of working paper. It has been submitted for publication with its Sections 4 and 5 omitted. 64 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25602 2026-01-13 cs.IR 50%

TRUE: A Reproducible Framework for LLM-Driven Relevance Judgment in Information Retrieval

TRUE: 一种用于信息检索中基于大语言模型的相关性判断的可重复框架

Mouly Dewan, Jiqun Liu, Chirag Shah

专题命中 工具调用 :workflow(abstract)

AI总结 TRUE是一种用于信息检索中基于大语言模型的相关性判断的可重复框架,通过迭代数据采样和推理评估多个相关性因素,提升相关性判断的可靠性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏