arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7434 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 569 篇

2608.04794 2026-08-06 cs.AI cs.LG 新提交 73%

Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation

有特权但有偏差:PI条件化教师如何破坏自蒸馏

Sarthak Harne, Chinmay Karkar, Yash Pandya, Ahmed Awadallah, Akshay Nambi

机构 * Microsoft Research(微软研究院)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现,以特权信息为条件的自蒸馏在低难度任务上有效,但在困难任务上会因特权信息偏差导致模型推理能力下降,其优化信号与任务成功脱钩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27083 2026-07-30 cs.LG cs.AI 新提交 73%

Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents

分数并非决策:大语言模型智能体工具获取的成本感知停止策略

Yicheng Feng, Yan Zhang, Yan Cheng, Wei Qi

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体工具获取的异构成本问题,提出CAM-DF及其轻量变体,通过训练停止决策的离线差距实现成本感知停止,在1343个任务上验证其优于基线,减少工具接触量的同时保持任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16131 2026-07-20 cs.CL cs.AI 新提交 73%

ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning

ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证

Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Waterloo(滑铁卢大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01426 2026-07-07 cs.AI cs.CL 新提交 73%

When Should Service Agents Reconsider? Difficulty-Routed Control in Customer-Service Operations

服务代理何时应重新考虑?客户服务运营中的难度路由控制

Qian Chen, Chengyuan Liu, Xin Yu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 工具调用 :tool-use(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出一种难度路由的服务控制架构,通过轻量级路由器将常规会话与操作耦合会话分流,在关键后端写入前集中审查,提升零售和航空任务的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26118 2026-06-26 cs.CY cs.AI cs.LG 新提交 73%

The Open Source Economic Index of AI Adoption and Capability

AI采纳与能力的开源经济指数

Seamus Somerstep, Aritra Guha, Divesh Srivastava, Yuekai Sun

机构 * University of Michigan(密歇根大学) AT&T Chief Data Office(AT&T首席数据办公室) IFM-MBZUAI

专题命中 工具调用 :AI agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 通过公开聊天数据和O*NET任务构建开源经济指数,衡量AI在各职业的采纳率与任务执行能力,发现金融、计算机和艺术行业采纳率最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24589 2026-06-24 cs.AI cs.CL 新提交 73%

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试

Khanak Khandelwal

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。

Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18023 2026-06-17 cs.LG cs.AI 新提交 73%

LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling

LoopCoder-v2: 仅循环一次以实现高效的测试时计算扩展

Jian Yang, Shawn Guo, Wei Zhang, Tianyu Zheng, Yaxin Du, Haau-Sing Li, Jiajun Wu, Yue Song, Yan Xing, Qingsong Cai, Zelong Huang, Chuan Hao, Ran Tao, Xianglong Liu, Wayne Xin Zhao, Mingjie Tang, Weifeng Lv, Ming Zhou, Bryan Dai

机构 * Beihang University(北京航空航天大学) IQuest Research Langboat(浪波) Renmin University of China(中国人民大学)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出并行循环Transformer(PLT)并研究循环次数选择,发现两循环变体在代码生成等任务上显著提升,而三循环以上性能下降,揭示了增益-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14885 2026-06-16 cs.AI cs.CL 新提交 73%

Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion

Dr-DCI: 通过动态工作空间扩展实现直接语料交互的规模化

Yi Lu, Zhuofeng Li, Ping Nie, Haoxiang Zhang, Yuyu Zhang, Kai Zou, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * University of Toronto(多伦多大学) Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(加州大学圣迭戈分校) Verdent AI Netmind AI

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出DR-DCI框架,将检索作为智能体可调用的动作来动态扩展本地工作空间,结合检索器的召回能力与DCI的局部操作精度,实现大规模语料上的高效搜索与验证。

Comments 25 pages, 4 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07992 2026-06-09 cs.AI cs.CR cs.SE 新提交 73%

VATS: Exploiting Implicit Authority in Error-Path Injection via Systematic Mutation

VATS: 通过系统性变异利用错误路径注入中的隐式权威

Harshil Patel, Kunal Pai

机构 * Harshil Patel Kunal Pai

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出VATS框架,通过七维变异生成对抗性负载,利用错误消息的隐式权威绕过安全机制,在四个前沿模型上实现高达100%的注入成功率。

Comments Published at Second Workshop on Agents in the Wild: Safety, Security, and Beyond (ICML 2026 AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16961 2026-07-21 cs.AI 新提交 72%

Lomekwi: Resource-Bounded Tool Discovery in LLM Agents

洛梅奎:大语言模型智能体中资源受限的工具发现

Roshan Klein-Seetharaman, Daniel Wang, Andrew Xu

机构 * Sea12 Technologies(Sea12科技公司) Yale University(耶鲁大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI;agentic(comments)

AI总结 研究受认知科学启发区分工具使用与发现,将工具发现分解为好奇心、识别和效率,表明该框架可用于现有任务,证明识别与模型大小成反比,还通过组合博弈及模拟环境观察到反比缩放。

Comments All authors contributed equally. 17 pages, 6 figures. Presented at the 2026 Conference on Learning Theory Workshop on Learning in an Agentic World

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20658 2026-08-24 cs.CR cs.ET 新提交 71%

The Claws in Plain Sight: Unauthorized Context Disclosure through LLM Agent Tool Calls

显而易见的爪痕:通过大语言模型智能体工具调用实现未授权的上下文信息泄露

Ben Dong, Zhonghao Guo, Tianyi Lu, Qian Wang

专题命中 工具调用 :agent(title)

AI总结 该研究提出Claw in Plain Sight攻击方法,通过构造任务相关内容框架诱导LLM智能体泄露上下文信息,实验显示其在多种模型上的会话级泄露率达20.8%-75.0%,提示需在工具参数执行前进行目的与目的地感知检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25208 2026-07-29 gr-qc astro-ph.HE astro-ph.IM 新提交 71%

GSpyNetTree-O4: an event validation tool used in the fourth LIGO-Virgo-KAGRA observing run

GSpyNetTree - O4:第四次LIGO - Virgo - KAGRA观测运行中使用的事件验证工具

Sofia Alvarez-Lopez, Man Leong Chan, Franz S. Herbst, Dhatri Raghunathan, Airene Ahuja, Annudesh Liyanage, Julian Ding, Alejandro Garcia-Varela, Raymond Ng, Jess McIver

专题命中 工具调用 :tool use(title)

AI总结 研究针对引力波探测器数据中的毛刺问题,在第四次LIGO - Virgo - KAGRA观测运行中部署GSpyNetTree - O4工具。通过新架构、扩充训练集及校准校正等方法,该工具在毛刺识别和无毛刺样本判断上表现良好,提高了引力波事件验证工作流程的自动化。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26226 2026-08-28 cs.AI 新提交 70%

LLM Agents for Time-Series: A Survey

面向时间序列的大语言模型(LLM)智能体:一项综述

Yilong Chen, Xiao Qin, Chenghao Liu, Liang Wu, Noelle I. Samia, Kaize Ding

机构 * Northwestern University(西北大学) Datadog AI Research(Datadog人工智能研究院) Nokia(诺基亚)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本综述针对LLM智能体在时间序列问题上设计差异大的问题,采用问题驱动分类法梳理现有系统,分析任务对架构等的影响,对比模型性能,为相关设计提供指南并指出未来缺口。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25198 2026-08-27 cs.AI 新提交 70%

Tunable Tool-Call Rates in LLM Agents via Representation Steering

通过表示调控实现LLM智能体中可调节的工具调用率

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

机构 * UC Santa Cruz(圣克鲁兹加利福尼亚大学) UC Berkeley(加利福尼亚大学伯克利分校)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究提出通过调控LLM残差流的线性方向,可在推理时无需额外训练调节工具调用率,使开放域问答准确率近翻倍,且能泛化到多种模型与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24570 2026-08-26 cs.AI 新提交 70%

EviDx: Evidence-Aware Active Diagnosis with Scaffolded LLM Agents

EviDx:基于证据感知的支架式大语言模型智能体主动诊断框架

Lihang Zeng, Shaoting Zhang, Xiaofan Zhang

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 EviDx是结合患者诊断环境、临床诊断支架与运行时控制模块的证据感知主动诊断框架,可提升LLM的诊断性能与过程稳定性,还能揭示模型的能力边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22421 2026-08-25 cs.AI 新提交 70%

Where World Models Break: Natural-Input Failure Discovery

世界模型何时失效:自然输入的故障发现

Zhanpeng Shi, Zi Liang, Rong Feng, Shiqin Tang, Xuyang Chen, Hongzong Li

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Generative AI Research and Development Center, The Hong Kong University of Science and Technology(香港科技大学生成式人工智能研发中心)

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文针对现有世界模型评估忽略灾难性故障风险的问题,提出 BasinLens 方法,可在有限查询预算下发现自然输入引发的可复现、局部持续的世界模型故障,暴露常规基准未覆盖的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18543 2026-08-20 cs.AI 新提交 70%

Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-Engagement

打通搜索与客户关系管理(CRM):将AI产品研究智能体应用于客户再互动的生产部署

Mandar Kulkarni, Pooja A., Samir Shah

机构 * Flipkart Internet Pvt Ltd(Flipkart互联网私人有限公司)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究提出打通搜索与CRM的AI产品研究智能体框架,在23天生产部署中验证其可提升WhatsApp推荐的CTR、带来GMV增长,实现客户再互动与旅程优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10743 2026-08-12 cs.CL 新提交 70%

Mitigating Context Interference for Reliable and Efficient Search Agents

缓解可靠高效搜索智能体的上下文干扰

Boyang Xue, Bin Wu, Shuofei Qiao, Sheng Wang, Rui Wang, Yiming Du, Hongru Wang, Jeff Z. Pan, Emine Yilmaz, Kam-Fai Wong, Aldo Lipani

机构 * The Chinese University of Hong Kong(香港中文大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) The University of Edinburgh(爱丁堡大学)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 本文针对多轮搜索智能体的上下文干扰问题,提出基于蒸馏的上下文优化器,将其纳入RL训练后可显著提升搜索智能体的可靠性与效率,开创了AI智能体“先优化上下文再生成”的新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06370 2026-08-07 cs.CL 新提交 70%

The Bitter Lesson of Tool Calling

工具调用的惨痛教训

Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.CL

AI总结 本研究在BFCL v4上对比14种模型的程序化工具调用与JSON工具调用,发现程序化工具调用在多数场景下性能更优且鲁棒性更强,是可行的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02518 2026-08-04 cs.AI cs.CY 新提交 70%

Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation

Magnet:通过能力累积检测跨会话的AI滥用

Natalie Isak, Matthew Dressman

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对AI集成体的跨会话滥用风险,提出Magnet方法,通过聚合跨会话累积的相关能力来检测此类滥用,填补了现有单会话检测的缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01822 2026-08-04 cs.AI 新提交 70%

SearchMaster: Grounded and Regulated Self-Play for Search Agents

SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架

Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28459 2026-07-31 cs.AI cs.LO 新提交 70%

LeanCSP: A Framework for Certifying Constraint Reformulation and Solving in Lean

LeanCSP:Lean中用于验证约束重构与求解的框架

Pablo Manrique, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 工具调用 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 本研究在Lean定理证明器中提出LeanCSP框架,可验证约束重构的语义正确性与求解器结果,其已验证对称性破缺能大幅减少求解搜索工作量,且Lean内认证成本可承受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23524 2026-07-28 cs.AI 新提交 70%

Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis

深度搜索中的委托智能:一种用于解缠能力诊断的可控框架

Xinhao Yao, Yuanzhuo Liu, Changhao Wang, Yunfei Yu, Haoran Tan, Yuyao Zhang, Ruifeng Ren, Minlong Peng, Yong Liu

机构 * UCAS(中国科学院大学) Renmin University of China(中国人民大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 研究深度搜索中委托智能,将其分解为搜索决策和信息合成与验证维度。通过开发可控合成管道构建DelegSearchBench及评估协议,实验证明仅用最终答案准确性不能充分表征深度搜索能力。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22651 2026-07-28 cs.AI 新提交 70%

ARdena: Scenario-driven control of real-time LLM agents

ARdena:实时大语言模型智能体的场景驱动控制

Luka Borozan, Domagoj Matijević

机构 * Faculty of Applied Mathematics and Informatics, University of Osijek Croatia(奥西耶克大学应用数学与信息学院,克罗地亚) Meet Intelligent Innovations LLC(Meet智能创新有限责任公司)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究如何在实时交互环境中控制大语言模型智能体行为,提出分层场景驱动的LLM控制框架,通过结构化提示实现运行时行为控制,在ARDena中实现该框架并评估,结果显示场景驱动提示能有效控制LLM智能体。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22529 2026-07-27 cs.CL 新提交 70%

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

技能自我博弈:通过协同进化技能拓展大语言模型能力边界

Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14582 2026-07-17 cs.AI 新提交 70%

MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research

MathCoPilot:一种用于数学研究的人机共生范式的交互式系统

Junjie Zhang, Jiayu Liu, Wenbin Liu, Zhenya Huang, Doudou Wang, Yan Jiang, Leiye Xu, Tao Xiong, Wen Huang, Qi Liu, Guoping Hu, Enhong Chen, Mengping Zhang, Xiangdong Ye

机构 * University of Science and Technology of China(中国科学技术大学) School of Mathematical Sciences, University of Science and Technology of China(中国科学技术大学数学科学学院)

专题命中 工具调用 :AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究提出MathCoPilot这人机共生的数学研究系统,统一三项核心能力。通过它在特定子集和定理上比较四个大语言模型,发现当前模型处理本科问题成功率高,但在特定领域定理上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13021 2026-07-15 cs.SE 新提交 70%

Software Supply Chains are Dead: Use-Case-Oriented Regeneration

软件供应链已死:面向用例的再生

Tanmay Singla, James C. Davis

专题命中 工具调用 :workflow(abstract);agentic(abstract);分类 cs.SE

AI总结 研究现代软件开发中构建与复用权衡因软件供应链攻击及生成式人工智能而改变,提出面向用例的再生范式,评估智能工作流程,通过对180个存储库-依赖对测量,证明该方法可行,推动软件采购向可验证的特定于存储库的代码合成发展。

Comments [ESEM'26-ERVR] Proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026 Emerging Results, Vision, and Reflection Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11444 2026-07-14 cs.CL 新提交 70%

UMoE:Unlocking Every Expert in Domain-Specific Training

UMoE:在特定领域训练中解锁每个专家

Xuefeng Li, Pengfei Liu

机构 * Qwen Team(通义千问团队) DeepSeek-AI(渊亭科技) Thinking Machines Lab(思维机器实验室) LLM-Core Xiaomi(小米大语言模型核心团队)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究针对特定领域训练中专家池不合理问题,提出UMoE流程,先修剪低显著性专家,再扩展专家池,最后应用标准SFT,该方法在多架构、多领域及多基准测试中优于直接SFT,能转化冗余容量,提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10508 2026-07-14 cs.DB cs.AI 新提交 70%

Confining Nondeterminism: AI-Driven Research Systems as DBMSs for Reliable, Non-Wasteful, Transparent, and Collaborative Research [Vision]

限制非确定性:作为数据库管理系统的人工智能驱动研究系统,实现可靠、无浪费、透明和协作式研究 [愿景]

Kyoungmin Kim, Anastasia Ailamaki

机构 * EPFL(瑞士联邦理工学院)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究指出大语言模型代理在研究中存在不可信问题,根源是代理循环的随机调用无法检查内部状态。借鉴数据库经验,建议用确定性带版本的数据流引擎组织研究项目,大语言模型作查询编译器,五条设计规则确保研究可靠、透明且协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10487 2026-07-14 cs.CR cs.AI 新提交 70%

Temporary Authority, Permanent Effects: Commit-Time Authorization for LLM Agents

临时权限,永久影响:大型语言模型代理的提交时间授权

Igor Santos-Grueiro

机构 * International University of La Rioja(拉里奥ja国际大学)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究大型语言模型代理提交时间授权问题,构建受控失效套件实验,发现端点成功率高但授权完成率低,评估缓解措施,提出CommitGuard可阻止过时持久影响尝试,指出端点成功是实用指标,授权提交是安全属性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏