arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93944 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5130 篇

2606.10304 2026-06-10 cs.CL 新提交 70%

MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

MIRAGE: LLM智能体中的极性翻转编码子空间

Pratibha Revankar, Kargi Chauhan, Jihye Kim, Sadiba Nusrat Nur, Vincent Siu, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.CL

AI总结 发现LLM智能体在隐蔽编码敏感数据时,残差流中存在共享的低维编码子空间,通过逻辑回归探针可高精度检测,并构建MIRAGE实时监控器,在126个场景中AUC达0.918,远超仅输出检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01248 2026-06-10 cs.LG 版本更新 70%

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data

$S^3$-R1: 通过合成数据学习逐步检索与回答

Harsh Goel, Akhil Udathu, Susmija Jabbireddy, Pradnesh Kalkar, Atharva Parulekar

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.LG

AI总结 提出S^3-R1框架,通过合成数据生成和密集奖励信号,解决强化学习后训练中稀疏奖励和缺乏多跳问题数据的问题,提升模型搜索与问答能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09315 2026-06-09 cs.CR cs.AI 新提交 70%

Brain-Prompt Injection: A Route-Safety Audit for BCI-LLM Agents

脑提示注入:BCI-LLM代理的路径安全审计

Jianwei Tai

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 提出路径安全审计契约,通过分离定理和共形校准量化BCI-LLM代理中脑信号注入攻击的风险,实验证明确认通道可降低路由风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07595 2026-06-09 cs.CV cs.AI cs.IR 新提交 70%

VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents

VisualLeakBench: 视觉语言智能体中可复现的动作边界传播失败

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 提出VisualLeakBench基准,评估视觉语言智能体在截图、文档等场景下将敏感文本从图像复制到工具参数中的动作边界传播失败,发现PII传播率达78.8%,不安全文本传播率达85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07538 2026-06-09 cs.IR cs.AI 新提交 70%

Bidirectional Semantic Complementary Tool Retrieval for Remote Sensing Agents

面向遥感智能体的双向语义互补工具检索

Zeyuan Wang, Dongyang Hou, Cheng Yang, Xuezhi Cui, Linrui Xu, Bo Yu, Gaozhi Zhou, Ziyu Li, Liangtian Liu, Kai Ouyang, Wang Guo, Lili Zhu, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Mechanical and Electrical Engineering, Central South University(机械与电子工程学院,中南大学) Hunan Key Laboratory of Land Resources Evaluation and Utilization, Hunan Provincial Institute of Land and Resources Planning(湖南省国土资源评价与利用重点实验室,湖南省国土资源规划院)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 针对遥感智能体工具检索中查询与文档语义不对称问题,提出双向语义互补方法:通过规划增强查询机制补充功能语义,利用动态工具依赖图注入上下文语义,显著提升复杂遥感任务工具检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12735 2026-06-09 cs.SE 版本更新 70%

OOPS: Automated generation of REST API specification via LLMs

OOPS: 通过大语言模型自动生成REST API规范

Hao Chen, Yunchun Li, Chen Chen, Fengxu Lin, Wei Li

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.SE

AI总结 提出OOPS方法,利用LLM对服务器代码进行静态分析,通过端点方法提取和OAS生成两步工作流,自动生成高质量OpenAPI规范,无需技术特定规则或人工干预。

Journal ref Journal of Systems and Software 239 (2026) 112914

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03163 2026-06-08 cs.MA cs.AI cs.DC 版本更新 70%

OpenAgenet / OAN Yellow Paper: Technical Architecture for Trust-Governed Resource Identity and Discovery

OpenAgenet/OAN:信任治理的智能体身份与发现技术架构

Jinliang Xu

机构 * OpenAgenet / OAN

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出OpenAgenet/OAN协议中立信任层技术架构,通过角色架构、身份对象、注册工作流、根治理生命周期、根验证包模型、授权感知发现、签名可信调用、验证要求、状态转换、安全属性、实现边界和部署考虑,实现异构智能体框架(包括MCP、A2A、ANP类系统及领域特定协议)的身份准入、可发现、可验证和安全交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11359 2026-06-02 cs.AI physics.data-an 70%

CVEvolve: Autonomous Algorithm Discovery for Unstructured Scientific Data Processing

CVEvolve:面向非结构化科学数据处理的自主算法发现

Ming Du, Xiangyu Yin, Yanqi Luo, Dishant Beniwal, Songyuan Tang, Hemant Sharma, Mathew J. Cherukara

机构 * Argonne National Laboratory(阿贡国家实验室) Advanced Photon Source(先进光子源)

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出CVEvolve,一种零代码自主智能体框架,通过多轮搜索与工具集成,自动发现用于非结构化科学数据处理的算法,并在多个任务上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07990 2026-05-27 cs.CL cs.AI cs.LG cs.SE 70%

Tool Calling is Linearly Readable and Steerable in Language Models

语言模型中的工具调用是线性可读且可引导的

Zekun Wu, Ze Wang, Seonglae Cho, Yufei Yang, Adriano Koshiyama, Sahan Bulathwela, Maria Perez-Ortiz

机构 * University College London(伦敦大学学院) Holistic AI Imperial College London(伦敦帝国学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文发现语言模型内部存在对应工具选择的线性方向,通过干预该方向可切换工具调用,并能提前检测潜在错误,在多个模型和基准上验证了有效性。

Comments 24 pages. ACL ARR May 2026 submission (EMNLP 2026 preferred venue); v2 reflects revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10593 2026-05-26 cs.SE cs.AI cs.CL cs.LG 70%

ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs

ToolRegistry: 一个用于函数调用LLM的协议无关工具管理库

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 工具调用 :function calling(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ToolRegistry系统,通过统一工具对象和注册表实现协议无关的工具管理,支持多种传输协议、可插拔后端和高级功能,显著减少集成代码并提升吞吐量。

Comments 16 pages, 4 figures, v3: add co-author, permission system, progressive tool disclosure, think-augmented calling, RPC framing, multi-provider support

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24426 2026-05-26 cs.CL 70%

SEAL: Synergistic Co-Evolution of Agents and Learning Environments

SEAL: 智能体与学习环境的协同共演化

Yihao Hu, Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu

机构 * Ant Group(蚂蚁集团) Westlake University(西湖大学) University of Michigan--Ann Arbor(密歇根大学安娜堡分校) University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 提出SEAL框架,通过协同演化智能体策略与训练环境,解决智能体与环境错配问题,在低资源多轮工具使用任务中提升性能并实现正向分布外迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22219 2026-05-22 cs.AI 70%

SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval

SGR-Bench: 对状态门控检索的搜索代理基准测试

Ningyuan Li, Haiyang Shen, Mugeng Liu, Yudong Han, Zhuofan Shi, Sixiong Xie, Yun Ma

机构 * Peking University(北京大学) Beijing University of Technology(北京理工大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出SGR-Bench,一个用于评估状态门控检索能力的基准数据集,包含100个专家 curated 任务,通过对比显式和隐式指导方法,揭示了搜索代理在处理状态门控检索任务时的主要挑战。

Comments Work in Progress. 23 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06556 2026-05-22 cs.CR cs.AI 70%

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

对增强工具的语义攻击:保护模型上下文协议免受描述级操纵

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文研究了通过工具描述符与外部工具交互的模型上下文协议(MCP)中存在的语义攻击问题,提出了一种分层防御方案,通过描述符完整性验证、预上下文语义审查和轻量级运行时防护机制,有效降低描述级操纵导致的不安全工具调用风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21965 2026-05-22 cs.CL 70%

SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents

SpecHop:连续推测用于加速多跳检索代理

Mehrdad Saberi, Keivan Rezaei, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 本文研究如何在不改变最终轨迹的情况下加速多跳工具使用过程,提出了一种连续推测框架SpecHop,通过维护多个推测线程和异步验证预测观测来减少延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21781 2026-05-22 cs.CL 70%

Reflective Prompt Tuning through Language Model Function-Calling

通过语言模型功能调用实现反思式提示调优

Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加穹实验室)

专题命中 工具调用 :workflow(abstract);function calling(abstract);分类 cs.CL

AI总结 本文提出了一种名为Reflective Prompt Tuning (RPT)的框架,利用语言模型功能调用模拟人类提示工程师的迭代工作流程,通过诊断函数评估目标模型,生成结构化诊断报告,并利用历史报告优化提示,从而提升提示效果和置信度校准。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19182 2026-05-20 cs.HC cs.AI 70%

YAC: Bridging Natural Language and Interactive Visual Exploration with Generative AI for Biomedical Data Discovery

YAC:通过生成式AI连接自然语言与交互式视觉探索,用于生物医学数据发现

Devin Lange, Shanghua Gao, Pengwei Sui, Priya Misner, Astrid van den Brandt, Austen Money, Nikolay Akhmetov, Lisa Choy, Marinka Zitnik, Nils Gehlenborg

机构 * Harvard Medical School(哈佛医学院)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出YAC系统,结合自然语言输入和交互式可视化,通过生成式AI提升生物医学数据发现接口的能力,通过用户研究和系统分析改进系统设计和功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00631 2026-05-19 cs.AI 70%

LiTS: A Modular Framework for LLM Tree Search

LiTS:一个用于LLM树搜索的模块化框架

Xinzhe Li, Yaguang Tao

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 工具调用 :tool use(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出LiTS,一个模块化框架,用于通过树搜索进行LLM推理,展示了其在语言推理、环境规划和工具使用任务中的可组合性,并发现无限动作空间中LLM策略多样性是有效树搜索的瓶颈。

Comments ACL 2026 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12710 2026-05-19 cs.CL cs.CR 70%

Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs

改进方法而非提示:针对大语言模型的进化式 jailbreak 攻击合成

Yunhao Chen, Xin Wang, Juncheng Li, Yixu Wang, Jie Li, Yan Teng, Yingchun Wang, Xingjun Ma

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出 EvoSynth 框架,通过在代码空间中进行搜索,而非仅在提示空间中优化,从而提高对大语言模型的 jailbreak 攻击成功率和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02028 2026-05-19 cs.CL 70%

Language models fail at extended rule following

语言模型在扩展规则遵循中表现不佳

Tianxiang Dai, Jonathan Fan

机构 * Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.CL

AI总结 研究发现语言模型在重复应用规则时无法保持精确状态,即使增加模型规模和计算资源也无法克服这一缺陷,表明需要新的模型架构来实现可靠的规则遵循。

Comments for accessing the data and code for reproduction of the study, see https://txdai.github.io/counting-reliability/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16191 2026-05-18 cs.CL cond-mat.other physics.comp-ph 70%

Optimized Three-Dimensional Photovoltaic Structures with LLM guided Tree Search

优化的三维光伏结构与LLM引导的树搜索

Michael P. Brenner, Lizzie Dorfman, John C. Platt

机构 * Google Research School of Engineering and Applied Sciences, Harvard University(谷歌研究工程与应用科学学院,哈佛大学) Google Research(谷歌研究)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 本文利用AI编码系统生成新型科学假设,通过LLM驱动的树搜索算法优化三维光伏结构,解决中纬度地区传统光伏板的效率瓶颈问题。

Comments 10 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12581 2026-05-18 cs.LO cs.AI cs.FL math.OC 70%

Ensuring Logic in the Fog: Sound POMDP Synthesis with LTL Objectives

确保雾中的逻辑:带有LTL目标的可靠POMDP综合

Can Zhou, Yulong Gao, Pian Yu

机构 * Imperial College London(伦敦帝国理工学院) University College London(伦敦大学学院)

专题命中 工具调用 :autonomous agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种新的可靠奖励塑造机制,用于在部分可观测马尔可夫决策过程中实现LTL目标的合成,通过增强的蒙特卡洛规划框架提升在部分可观测环境中的导航能力。

Comments Accepted by IJCAI-ECAI 2026, the 35th International Joint Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10172 2026-05-12 cs.CV cs.CL 70%

V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

V-ABS:基于动作-观察者的动态视觉推理束搜索

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) SenseTime Research(商汤科技研究院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出V-ABS框架,通过思考-行动-观察循环和熵适应加权算法,缓解IAO偏差,提升多模态模型在复杂视觉推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11790 2026-05-12 cs.CR cs.AI 70%

ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection

ClawGuard:一种用于对抗间接提示注入的工具增强LLM代理运行时安全框架

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 ClawGuard通过在工具调用边界实施用户确认规则集,有效阻止间接提示注入攻击,无需修改模型或基础设施,实验显示其在多个基准测试中均能提供可靠保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09932 2026-05-12 cs.CL 70%

FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning

FocuSFT:基于稀释意识的长上下文微调的双层优化

Zehua Pei, Hui-Ling Zhen, Xianzhi Yu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 FocuSFT通过双层优化框架解决长上下文微调中注意力稀释问题,提升模型在长上下文下的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04323 2026-05-11 cs.LG cs.DB 70%

LUCAS-MEGA: A Large-Scale Multimodal Dataset for Representation Learning in Soil-Environment Systems

LUCAS-MEGA:一个大规模多模态数据集,用于土壤-环境系统的表示学习

Kuangdai Leng, Simon Jeffery, Panos Panagos, Tarje Nissen-Meyer

机构 * Earth Rover Program(Earth Rover项目) Centre for Crop and Environmental Science(作物与环境科学中心) European Commission Joint Research Centre(欧盟联合研究中心) Department of Mathematics and Statistics & Center for Environmental Intelligence(数学与统计系及环境智能中心)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 LUCAS-MEGA通过系统数据融合构建了大规模多模态数据集,用于提升土壤-环境系统的表示学习能力,通过SoilFuser管道标准化数据并生成统一特征空间,预训练SoilFormer模型实现了稳定的训练和预测性能。

Comments 27 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20146 2026-04-23 cs.IR cs.CL 70%

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

SAKE: 为基于地面的多模态命名实体识别的自我意识知识利用-探索

Jielong Tang, Xujie Yuan, Jiayang Liu, Jianxing Yu, Xiao Dong, Lin Chen, Yunlai Teng, Shimin Di, Jian Yin

机构 * Sun Yat-sen University(中山大学) Shandong Normal University(山东师范大学) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 针对开放世界社交媒体平台中长尾、快速演变和未见实体的挑战,SAKE提出一种端到端代理框架,通过自我意识推理和自适应搜索工具调用,结合内部知识利用和外部知识探索,提升多模态命名实体识别的精度与鲁棒性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20144 2026-04-23 cs.CL 70%

Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents

轨迹到任务:通过合成且可验证的数据训练鲁棒的工具调用代理以应对复杂用户意图

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Pei Chen, Ziwei Dong, Jing Huang, Jiri Gesi, Xianfeng Tang, Chen Luo, Qun Liu, Yisi Sang, Hanqing Lu, Manling Li, Jin Lai, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon(亚马逊) Northwestern University(西北大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出Trajectory2Task方法,通过合成可验证数据提升工具调用代理在复杂用户意图下的鲁棒性,通过多轮探索生成有效工具调用轨迹,并转换为可验证任务,最终在七种先进LLM上验证了改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18976 2026-04-22 cs.CL 70%

STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming

STAR-Teaming:一种基于策略-响应多plex网络的自动化LLM红队方法

MinJae Jung, YongTaek Lim, Chaeyun Kim, Junghwan Kim, Kihyun Kim, Minwoo Kim

机构 * DATUMO INC(DATUMO公司)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出STAR-Teaming,一种基于多plex网络的自动化红队方法,通过网络驱动优化生成有效攻击策略,提升LLM策略漏洞的可解释性并降低计算成本。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15690 2026-04-21 cs.AI stat.AP 70%

From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models

从被动度量到主动信号:不确定性量化在大语言模型中的演变角色

Jiaxin Zhang, Wendi Cui, Zhuohang Li, Lifu Huang, Bradley Malin, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) Intuit(Intuit公司) Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 工具调用 :autonomous agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文探讨大语言模型中不确定性量化从被动诊断指标到主动控制信号的演变,分析其在高级推理、自主代理和强化学习中的应用及贡献。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15597 2026-04-20 cs.CL cs.HC 70%

LLMs Corrupt Your Documents When You Delegate

当您委托时,大型语言模型会破坏您的文档

Philippe Laban, Tobias Schnabel, Jennifer Neville

机构 * Microsoft Research(微软研究院)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究发现,当前LLM在委托工作中会破坏文档,即使前沿模型也平均破坏25%的内容,文档大小和交互长度加剧了这一问题。

详情

展开后加载摘要…

URL PDF HTML 收藏