arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 518 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 518 篇

2606.08016 2026-06-09 cs.CV cs.AI cs.CL 新提交 84%

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院) Huawei Technologies Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。

Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 84%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 工具调用 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10042 2026-08-12 cs.LG cs.AI 新提交 84%

UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs

UserToolBench:用于工具使用类大语言模型个性化决策的用户画像隐藏型基准测试集

Xuexiong Yin, Zechuan Chen, Yongsen Zheng, Yuxiang Zhang, Jingyuan Yang, Bin Wang, Yubin Wang, Keze Wang

机构 * Sun Yat-Sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.LG

AI总结 UserToolBench是针对工具使用类大语言模型的基准测试集,可评估模型从交互历史推断用户偏好等个性化决策能力,实验发现当前模型在多工具协调等方面仍存瓶颈。

Comments 21pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26656 2026-07-30 cs.CR cs.AI cs.SE 新提交 84%

Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

图作为验证器:用于过程间漏洞检测的智能体强化学习

Yikun Li, Ting Zhang, Jiakun Liu, Jinfeng Jiang, Yuheng Yieh, Yixin Yang, Wen Bin Leow, Yide Yin, Yintong Huo, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对现有漏洞检测孤立处理函数的问题,提出基于CPG的智能体强化学习框架VulAgentRL,通过图验证设计可靠奖励并预热初始化策略,在仓库级划分下的严格指标及多场景中均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11042 2026-07-14 cs.SE cs.AI 新提交 84%

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

BackendForge:使用后端服务对智能端到端代码生成进行基准测试

Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) SCS, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07379 2026-07-09 cs.AI cs.LG 新提交 84%

Physics-Audited Agentic Discovery in Scientific Machine Learning

科学机器学习中的物理审核智能发现

Diab W. Abueidda, Bilal Ahmed, Panos Pantidis, Mostafa E. Mobasher

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) National Center for Supercomputing Applications, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校国家超级计算应用中心)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能科学机器学习中替代模型选择问题,提出物理审核智能SciML工作流程,先确定评分评估器,推导物理要求并检查候选者输出,搜索违规情况。通过数值示例验证,该方法能选到满足物理条件的替代模型,区别于仅靠综合分数的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03953 2026-07-07 cs.CL cs.AI 新提交 84%

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models

为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究

Alexander Somma, Isabelle Plante, Fred Premji

机构 * Sage.is AI-UI(Sage.is人工智能用户界面)

专题命中 工具调用 :AI agent(title);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。

Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03441 2026-07-07 cs.LG cs.AI 新提交 84%

No Time Like the Present: Agentic Test-Time Training for LLM Agents

机不可失:大语言模型智能体的测试时训练

Yanbo Wang, Jinhua Hao, Yuze Shi, Kun Yuan, Ming Sun

机构 * Kuaishou Technology(快手科技)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮智能体情节中的连续测试时训练,提出智能体测试时训练方法,通过token级重加权减少重复文本损失,构建并发服务系统,提升了在ALFWorld和SWE-bench Lite上的成功率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26474 2026-06-26 cs.LG cs.AI 新提交 84%

Localizing RL-Induced Tool Use to a Single Crosscoder Feature

将RL诱导的工具使用定位到单个交叉编码器特征

Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani, Bowen Cheng, Gustavo Mercier, Jessica Hullman

专题命中 工具调用 :tool use(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出专用特征交叉编码器(DFC)隔离强化学习引入的紧凑特征集,通过编码-解码重建提升工具调用正确率31.1个百分点,并实现能力溢出至冻结基模型。

Comments Accepted as a spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 84%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11543 2026-06-11 cs.AI cs.SE 新提交 84%

SkillJuror: Measuring How Agent Skill Organization Changes Runtime Behavior

SkillJuror:衡量智能体技能组织如何改变运行时行为

Zhiyu Chen, Zihan Guo, Bo Huang, Bingwei Lu, Jianghao Lin, Yuanjian Zhou, Weinan Zhang

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出SkillJuror框架,通过渐进式披露与扁平基线对比,发现技能组织方式改变智能体搜索和应用程序知识的行为,并在82个任务中提升4.1%的验证通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09138 2026-06-09 cs.LG cs.CL 新提交 84%

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Claw-R1:面向智能体强化学习的步骤级数据中间件系统

Daoyu Wang, Mingyue Cheng, Qingchuan Li, Shuo Yu, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 提出Claw-R1系统,通过网关服务器和数据池组件,将智能体交互步骤转化为结构化数据资产,支持实时检查、质量筛选和训练批次配置,解决智能体强化学习中数据生命周期管理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16370 2026-08-18 cs.AI 新提交 83%

What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics

上下文压缩会给智能体带来什么代价?任务完成指标未揭示的交互代价

Shuyu Liu

机构 * Chongqing University of Science and Technology(重庆科技学院)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对使用工具的智能体,发现上下文压缩会带来任务完成指标未揭示的隐藏交互成本,检索调用增加是其主要来源,且该特征具有环境依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16207 2026-08-18 cs.AI 新提交 83%

Competing at Every Price Point with Agentic Evolution over a Menu of LLMs

基于LLMs菜单的智能体进化,在每个价格点展开竞争

Andrew Borthwick

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出进化元智能体RoboPhD,通过对含9个LLM端点的菜单进行智能体进化,在DS-1000和PaperFindingBench两个任务上,除一个位置外占据所有帕累托前沿槽位,实现各价格点的竞争优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15145 2026-08-18 cs.AI 新提交 83%

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

ACTS-SQL:基于大型语言模型的面向智能体与评判器的树结构化SQL正确性校验

Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

机构 * Renmin University of China(中国人民大学) ByteDance Inc.(字节跳动公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出无训练框架ACTS-SQL,将SQL修正建模为计划引导的树结构化调试过程,集成执行校验与诊断工具,在BIRD-Critic基准及火山引擎TLS生产环境中均实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15776 2026-08-18 cond-mat.mtrl-sci cs.AI 新提交 83%

ALKEMIE Agent: an autonomous platform for computational materials design

ALKEMIE智能体:用于计算材料设计的自主平台

Hongfu Huang, Yuzhe Li, Ao Xu, Bo Liu, Changrui Wang, Kan Tang, Ning Yang, Shengxian Liu, Hanyu Liu, Pengpeng Zhang, Linggang Zhu, Fengkai Liu, Yichen Lu, Tong Zhao, Naihua Miao, Jian Zhou, Zhimei Sun

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对材料计算工作流程碎片化的问题,提出集成多种技术的ALKEMIE智能体平台,通过多种材料相关应用验证其能力,并展望了该类平台的未来发展方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12282 2026-08-13 cs.AI 新提交 83%

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

VAKRA:评估工具使用策略下跨API与检索的多跳推理能力

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

机构 * IBM(国际商业机器公司(IBM))

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10039 2026-08-12 cs.LG 新提交 83%

FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows

FlowScout:从执行反馈到可靠的工具使用智能体工作流

Shuo Hao, You Lu, Bihuan Chen, Xin Peng

专题命中 工具调用 :agent(title);workflow(abstract);agentic(abstract);分类 cs.LG

AI总结 FlowScout是从历史任务记录生成工具集成型智能体工作流的执行引导框架,经多任务域评估,其工具调用正确性与执行质量均显著优于PM4Py等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06270 2026-08-07 cs.AI 新提交 83%

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

视觉工具使用的错觉:对图像思考的因果审查

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 工具调用 :tool-use(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05359 2026-08-07 cs.AI 新提交 83%

CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction

CASCADE:一种用于经患者数据验证的下游扰动预测的智能体调控网络框架

Jose A. Bird

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究提出CASCADE智能体调控网络框架,基于ARACNe网络预测基因扰动下游转录效应,通过TCGA、METABRIC数据验证其MYC基因预测方向的准确性,还评估LLM智能体映射自然语言请求至MCP工具调用的表现,发现其在模糊查询时存在错误选择扰动类型的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 83%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00969 2026-08-04 cs.AI 新提交 83%

PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体

Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Aounon Kumar, Yashas Malur Saidutta, Wenbo Li, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29254 2026-08-03 cs.AI 新提交 83%

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

工具规格很重要:揭示和缓解AI智能体中的安全风险

Minghui Pan, Jiayuxuan Yang, Yuanyuan Yuan, Yu Jiang, Zhenpeng Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27235 2026-07-31 cs.AI cs.CV 新提交 83%

RadHarmony: Radiological Data Handling in the Era of Agentic AI

RadHarmony:智能体AI时代的放射数据处理方案

Frank Li, Bardia Khosravi, Mohammadreza Chavoshi, Theo Dapamede, YoungSeok Jeon, Janice Newsome, Hari Trivedi, Judy Gichoya

机构 * Emory University(埃默里大学) Yale University(耶鲁大学)

专题命中 工具调用 :agentic(title);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 RadHarmony是一款开源Python库,用于统一处理异构放射数据集,引入AI智能体技能简化数据集整合,可预训练视觉Transformer基线并提供相关代码与模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26070 2026-07-30 cs.IR cs.AI 新提交 83%

SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search

SimpleWikiSearch:用于智能体搜索的简洁离线维基百科环境

Guanming Xiong, Penghui Zhang

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 SimpleWikiSearch是一套明确可运行的离线维基百科环境,用于智能体搜索的可复现评估,提供基线结果及对比闭源模型的子集,而非提出新智能体算法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18847 2026-07-22 cs.CR cs.AI 新提交 83%

Data Leakage Prevention in Agentic Applications via Preemptive Hardening

通过先发制硬化防止智能应用中的数据泄露

Akansha Shukla, Emily Bellov, Parth Atulbhai Gandhi, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 工具调用 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18816 2026-07-22 cs.DB cs.AI 新提交 83%

AgentTrails: Towards Trust and Reuse for Agentic Tasks

AgentTrails:迈向代理任务的信任与重用

Eden Wu, Sonia Castelo, Yurong Liu, Cláudio T. Silva, Juliana Freire

机构 * New York University(纽约大学)

专题命中 工具调用 :agentic(title);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 针对大语言模型驱动代理轨迹掩盖数据依赖限制开发人员理解等问题,提出AgentTrails系统,将原始轨迹转换为结构化溯源图,支持执行比较、模式提取等,能揭示隐藏依赖、对齐不同执行并展现重复工具使用模式。

Comments 4 pages, 4 figures. Short paper accepted at the Workshop on Systems for Data-centric Agents with Human-in-the-loop (DASHSys 2026), co-located with VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交 83%

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15253 2026-07-17 cs.IR cs.CL 新提交 83%

Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search

桥梁证据:静态检索效用无法预测多步智能体搜索中的因果效用

Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee

机构 * University of Calcutta(卡塔克大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 研究智能体检索中静态检索效用与因果效用的差异,通过在HotpotQA上用ReAct风格智能体实验,比较原始与反事实运行得CTU分数,发现两者近乎独立,约三分之一文档为桥梁文档,还确定了相关机制,指出优化静态相关性无法带来因果有用性。

Comments Preprint; extended version in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13474 2026-07-16 cs.CL 新提交 83%

MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems

MyAG:一种用于设计和分析可组合大语言模型智能体系统的基于图的框架

Zhisong Zhang

机构 * City University of Hong Kong(香港城市大学)

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.CL

AI总结 介绍用于设计和分析可组合大语言模型智能体系统的MyAG框架,它将构建分为三个图抽象,支持分层组合,提供监控和可视化工具,实验表明其能支持灵活设计并助于分析性能-效率权衡,且已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏