arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2606.05658 2026-06-05 cs.IR cs.AI 91%

Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval

Agent编排的自适应RAG:结构化与多跳检索的比较研究

Anuj Maharjan, Devinder Kaur, Richard Molyet

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 提出Agent编排的自适应RAG框架,通过动态查询分解、迭代检索和自反思评估,在结构化领域(DevOps)和多跳推理基准(MuSiQue)上对比发现,查询分解在结构化领域提升性能但降低多跳排名精度,反思机制提高引用准确性但增加延迟,表明Agent增强需根据查询和领域特性选择性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11946 2026-06-01 cs.AI 91%

Counterfactual Trace Auditing of LLM Agent Skills

LLM Agent技能的反事实痕迹审计

Xiaolin Zhou, Jinbo Liu, Li Li, Ryan A. Rossi, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Adobe Research(Adobe研究)

专题命中 Agent评测 :agent(title,title_cn);planning(abstract);分类 cs.AI

AI总结 提出反事实痕迹审计(CTA)框架,通过配对有无技能的Agent轨迹并生成结构化技能影响模式(SIP)注释,揭示技能对行为的重塑效应,弥补仅通过通过率评估的不足。

Comments Code and data are available at https://github.com/WillChow66/CTA.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29560 2026-05-29 cs.AI 91%

Battery-Sim-Agent: Leveraging LLM-Agent for Inverse Battery Parameter Estimation

Battery-Sim-Agent: 利用LLM智能体进行电池逆参数估计

Jiawei Chen, Xiaofan Gui, Shikai Fang, Shengyu Tao, Shun Zheng, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research(微软研究院) Zhejiang University(浙江大学) Chalmers University of Technology(皇家理工学院)

专题命中 Agent评测 :agent(title,title_cn);workflow(abstract);分类 cs.AI

AI总结 提出Battery-Sim-Agent框架,将电池逆参数估计重构为推理任务,利用LLM智能体与高保真模拟器闭环交互,通过物理假设和结构化参数更新,显著优于贝叶斯优化等黑箱优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14987 2026-05-22 cs.CL cs.DB 91%

Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI

超越基准岛屿:面向代理AI的代表性可信度评估

Jinhu Qi, Yifan Li, Minghao Zhao, Wentao Zhang, Zijian Zhang, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工学院) Jilin University(吉林大学)

专题命中 Agent评测 :agentic(title,abstract);agent(summary_cn,abstract);tool use(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种基于五属性的代理可信度定义,并引入了Holographic Agent Assessment Framework(HAAF)框架,通过场景 manifold 的静态策略分析、沙盒模拟、社会伦理对齐评估和分布感知采样,实现对代理系统在社会技术场景中的可信度评估,展示了其在13个模型家族上的跨家族迁移实验结果。

Comments 9 pages, 3 figures, 8 tables. Submitted to the Agent4IR Workshop at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22569 2026-05-20 cs.CR cs.AI 91%

Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection

财富低语:通过提示注入对谷歌的Agent支付协议进行红队测试

Tanusree Debi, Wentian Zhu, Pranjol Sen Gupta

机构 * School of Computing University of Georgia Athens, USA(佐治亚大学计算机学院 美国亚特兰大) Department of Information Technology Kennesaw State University Kennesaw, USA(凯斯韦尔州立大学信息科技学院 美国凯斯韦尔)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 本文通过红队测试评估了谷歌的Agent支付协议,揭示了由于间接和直接提示注入导致的漏洞,并提出了两种攻击技术,即品牌低语攻击和宝库低语攻击,以操纵产品排名并提取敏感用户数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21936 2026-04-27 cs.AI cs.CV cs.MA 91%

An Artifact-based Agent Framework for Adaptive and Reproducible Medical Image Processing

基于 artifact 的 agent 框架用于自适应和可重复的医学图像处理

Lianrui Zuo, Yihao Liu, Gaurav Rudravaram, Karthik Ramadass, Aravind R. Krishnan, Michael D. Phillips, Yelena G. Bodien, Mayur B. Patel, Paula Trujillo, Yency Forero Martinez, Stephen A. Deppen, Eric L. Grogan, Fabien Maldonado, Kevin McGann, Hudson M. Holmes, Laurie E. Cutting, Yuankai Huo, Bennett A. Landman

机构 * Dept. of Electrical and Computer Engineering, Vanderbilt University(电气与计算机工程系,范德比尔特大学) Dept. of Computer Science, Vanderbilt University(计算机科学系,范德比尔特大学) Dept. of Biomedical Engineering, Vanderbilt University(生物医学工程系,范德比尔特大学) Dept. of Surgery, Vanderbilt University Medical Center(外科系,范德比尔特大学医学中心) Dept. of Neurology, Vanderbilt University Medical Center(神经病学系,范德比尔特大学医学中心) Dept. of Medicine, Vanderbilt University Medical Center(医学系,范德比尔特大学医学中心) Dept. of Thoracic Surgery, Vanderbilt University Medical Center(胸外科系,范德比尔特大学医学中心) Dept. of Biomedical Informatics, Vanderbilt University Medical Center(生物医学信息学系,范德比尔特大学医学中心) Dept. of Radiology and Radiological Sciences, Vanderbilt University Medical Center(放射学与放射科学系,范德比尔特大学医学中心) Vanderbilt University Institute of Imaging Science(范德比尔特大学成像科学研究所) Veteran Affairs, Tennessee Valley Healthcare System(退伍军人事务,田纳西河流域医疗系统) Peabody College, Vanderbilt University(佩博利学院,范德比尔特大学) Vanderbilt Brain Institute, Vanderbilt University(范德比尔特脑研究院,范德比尔特大学)

专题命中 Agent评测 :agent(title,title_cn);workflow(abstract);分类 cs.AI

AI总结 本文提出基于 artifact 的 agent 框架,用于在真实临床环境中实现自适应和可重复的医学图像处理,通过语义层和模块化规则库实现工作流配置和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 91%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);workflow(abstract)

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05608 2026-06-11 cs.SE cs.AI 版本更新 91%

Agentic Software: How AI Agents Are Restructuring the Software Paradigm

软件工程的终结:AI代理如何根本性地重构软件范式

Zhenfeng Cao

机构 * Lingxi Intelligent Investment (Shenzhen) Development Co., Ltd.(灵犀智能投资(深圳)发展有限公司)

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文通过第一性原理分析,论证了以LLM为推理引擎的AI代理系统正在根本性地重构软件范式,从传统软件(代码承载决策逻辑)转向代理系统(代码作为临时工具),并提出了代理工程作为新兴学科。

Comments 15 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22302 2026-02-27 cs.AI cs.MA cs.SE 91%

Agent Behavioral Contracts: Formal Specification and Runtime Enforcement for Reliable Autonomous AI Agents

智能体行为契约:为可靠自主AI智能体的正式规范与运行时执行

Varun Pratap Bhardwaj

机构 * Accenture(埃森哲)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出智能体行为契约框架,通过形式化规范和运行时执行,提升自主AI智能体的可靠性与行为可控性。

Comments 71 pages, 7 figures, 14 tables. Patent pending. Also available on Zenodo: DOI 10.5281/zenodo.18775393

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15940 2025-08-25 cs.AR cs.AI cs.CL cs.DC cs.MA 91%

ASIC-Agent: An Autonomous Multi-Agent System for ASIC Design with Benchmark Evaluation

Ahmed Allam, Youssef Mansour, Mohamed Shalan

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

Comments 2025 IEEE International Conference on LLM-Aided Design (ICLAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01635 2025-02-04 cs.SE cs.AI 91%

The AI Agent Index

Stephen Casper, Luke Bailey, Rosco Hunter, Carson Ezell, Emma Cabalé, Michael Gerovitch, Stewart Slocum, Kevin Wei, Nikola Jurkovic, Ariba Khan, Phillip J. K. Christoffersen, A. Pinar Ozisik, Rakshit Trivedi, Dylan Hadfield-Menell, Noam Kolt

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);agentic(abstract)

Comments Accompanying website: https://aiagentindex.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27705 2026-05-28 cs.CR cs.MM 90%

AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks?

AgenticVBench: AI代理能否完成真实的后期制作任务?

Zongheng Cao, Yi Zheng, Rui Song, Xinyu Hu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 本文提出AgenticVBench基准,包含100个来自真实后期制作流程的代理任务,评估多模态AI代理的复合能力,发现最佳代理栈性能仅略超30%,远低于人类专家。

Comments 22 pages, 6 figures. Benchmark website: https://agenticvbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19263 2026-08-21 cs.SE cs.MA 新提交 90%

The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation

评估上下文协议(ECP):一种用于AI智能体评估的便携式契约

Aniket Wattamwar, Manav Anandani, Mrunal Kakirwar

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);autonomous agent(abstract);agentic(abstract)

AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。

Comments 14 pages, 4 tables, 4 figures, Code available at https://github.com/evaluation-context-protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16571 2026-05-11 cs.AI cs.IR cs.MA 90%

LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence

基于大语言模型的竞品映射 agent 在药物资产尽调中的应用

Vlad Vinogradov, Alisa Vinogradova, Dmitrii Radkevich, Ilya Yasny, Dmitry Kobyzev, Ivan Izmailov, Katsiaryna Yanchanka, Roman Doronin, Andrey Doronichev

机构 * LanceBio Ventures AI Expert

专题命中 Agent评测 :agent(title_cn,summary_cn);AI agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的竞品发现 agent,通过结构化数据处理提升药物资产尽调效率,实现竞品检索与属性标准化,实验结果显示其召回率优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14989 2026-04-28 cs.AI cs.AR 90%

Dr. RTL: Autonomous Agentic RTL Optimization through Tool-Grounded Self-Improvement

Dr. RTL:通过工具引导的自我改进实现自主代理RTL优化

Wenji Fang, Yao Lu, Shang Liu, Jing Wang, Ziyan Guo, Junxian He, Fengbin Tu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(title);agent(abstract);workflow(abstract)

AI总结 Dr. RTL通过真实环境下的闭环优化和群体相对技能学习,提升RTL时序优化的性能、功耗和面积指标,实现更高效的自改进优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12006 2025-11-12 cs.AI 90%

SOCIA-$\nabla$: Textual Gradient Meets Multi-Agent Orchestration for Automated Simulator Generation

Yuncheng Hua, Sion Weatherhead, Mehdi Jafari, Hao Xue, Flora D. Salim

机构 * School of Computer Science Engineering, University of New South Wales(计算机科学工程学院,新南威尔士大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

Comments 11 pages, 1 figure, 2 tables. The paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18551 2025-11-11 cs.AI 90%

SOCIA-Nabla: Textual Gradient Meets Multi-Agent Orchestration for Automated Simulator Generation

Yuncheng Hua, Sion Weatherhead, Mehdi Jafari, Hao Xue, Flora D. Salim

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

Comments superseded by newest version of arXiv:2505.12006

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25612 2025-10-30 cs.AI cs.MA 90%

Counterfactual-based Agent Influence Ranker for Agentic AI Workflows

Amit Giloni, Chiara Picardi, Roy Betser, Shamik Bose, Aishvariya Priya Rathina Sabapathy, Roman Vainshtein

机构 * Fujitsu Research of Europe, UK(富士通欧洲研究中心)

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);workflow(abstract);multi-agent(abstract)

Comments Accepted to EMNLP 2025, 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25656 2026-06-25 cs.CL cs.AI cs.IR 新提交 90%

Is GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization

是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案

Long Chen, Ryan Razkenari, Yuxuan Zhou, Yuan Tian, Rahul Ghosh, Venkatesh Pappakrishnan, Disha Ahuja, Vidya Sagar Ravipati

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) Cisco Systems, Inc.(思科系统公司)

专题命中 Agent评测 :agentic(title,summary_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。

Comments Accepted to ACL 2026 GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00326 2026-06-23 cs.AI cs.CL cs.IR 90%

Agent-OM: Leveraging LLM Agents for Ontology Matching

Agent-OM:利用大语言模型代理进行本体匹配

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.CL

AI总结 本文提出Agent-OM框架,结合检索与匹配代理及OM工具,有效提升复杂和少样本本体匹配任务性能,接近传统最佳表现。

Comments 31 pages - VLDB 2025 (Page 1-20), OM 2025 (Page 21-31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03271 2026-07-30 cs.HC 90%

Agentic Relationship Harm: Benchmarking and Gating Relational Manipulation in AI Agents

代理关系伤害:AI代理中关系操纵的基准测试与门控

Pei-Sze Tan, Tasuku Igarashi, Isao Echizen

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);workflow(abstract)

AI总结 针对AI代理可能造成的关系操纵风险,提出了一个110提示的基准测试、关系特定标注框架和轻量级后生成策略门控,以评估和缓解代理关系伤害。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15579 2026-06-16 cs.AI cs.LG cs.MA cs.SE 新提交 90%

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

你的智能体有基因组:基于序列的LLM驱动自主智能体行为分析与运行时治理

Sidi Deng

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出XEPV序列编码框架,将LLM智能体行为建模为基因组序列,通过n-gram挖掘发现P-X-P高风险模式,设计Governor三层干预系统,使成功率提升6.2%并减少44% token消耗。

Comments 16 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14468 2026-03-17 cs.CV cs.IR 90%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 Agent评测 :planning(title,abstract);agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22584 2025-10-08 cs.LG cs.AI cs.CL 90%

BenchAgents: Multi-Agent Systems for Structured Benchmark Creation

Natasha Butt, Varun Chandrasekaran, Neel Joshi, Besmira Nushi, Vidhisha Balachandran

机构 * University of Amsterdam(阿姆斯特丹大学) Microsoft Research(微软研究院) UIUC(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16832 2025-05-29 cs.AI cs.CL cs.CV cs.LG 90%

From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization

Haonian Ji, Shi Qiu, Siyang Xin, Siwei Han, Zhaorun Chen, Dake Zhang, Hongyi Wang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Chicago(芝加哥大学) Rutgers University(罗格斯大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 16 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16989 2026-07-22 cs.CL cs.AI cs.DL cs.HC 版本更新 90%

Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries

人工智能代理起草转化影响摘要的实际评估

Mohammad Arvan, Amber E. Osterholt, Bailee Rue, Yuvaneswaren R. Sureshbabu, Krishna R. Patel, Rebecca T. Feinstein, Bethany C. Bray, Niranjan S. Karnik

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究针对CTSA项目人工整理学者研究影响耗时久且难扩展的问题,构建人工参与的AI代理。该代理为学者整理证据档案、起草影响摘要,经评估,在CTSA中心工作流程中表现良好,能提高效率、实现队列规模影响报告。

Comments 15 pages, 5 figures, 2 tables. Submitted to the Journal of Clinical and Translational Science. Code: https://github.com/mo-arvan/scholar-dossier-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04455 2026-06-04 cs.AI cs.CL 90%

The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?

元智能体挑战:当前智能体能否自主开发智能体?

Xinyu Lu, Tianshu Wang, Pengbo Wang, zujie wen, Zhiqiang Zhang, Jun Zhou, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出元智能体挑战(MAC)框架,评估前沿模型自主开发智能体系统的能力,发现多数元智能体难以匹敌人类设计的基线策略,且存在鲁棒性和对齐问题。

Comments Website: https://meta-agent-challenge.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19779 2026-05-20 cs.AI cs.LG 90%

Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation

无分布不确定性量化用于连续AI代理评估

Yuxuan Gao, Megan Wang, Yi Ling Yu

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无分布的不确定性量化方法,用于连续AI代理评估,通过适应性符合推断(ACI)提供预测质量分数的覆盖保证,并开发了多代理管道的组合不确定性界限、成对排名的符合回避规则以及领奖台规模多重检验的FDR校正回避方法。

Comments 6 pages, 7 figures, 2 tables. Accepted at the ICML 2026 Workshop on Agentic Uncertainty Quantification (AgenticUQ) - Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17933 2026-08-19 cs.AI cs.CE 新提交 90%

EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection

EvoTS-Agent:一种用于金融时间序列变点检测的自进化大语言模型智能体

Lei Jiang, Ye Wei, Xinyu Xi, Jordan Langham-Lopez, Yifan Bao, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni

机构 * Alan Turing Institute(阿兰·图灵研究所) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) NatWest AI Research(国民西敏寺银行人工智能研究部) University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 该研究针对金融时间序列变点检测难题,提出自进化 LLM 智能体 EvoTS-Agent,经验证引导进化检测流程,在四个基准数据集上表现优于现有同类智能体且执行成功率达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10768 2026-07-14 cs.AI 新提交 90%

Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

Opti-Agent-Bench:在实际业务问题上对端到端优化研发智能体进行基准测试

Yongchang Fu, Xinjie Huang, Chengjun Dai, Chengzhe Feng, Junshao Zhang, Hong Zhu

机构 * Ding Talk, Alibaba Group(钉钉,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 研究针对大语言模型解决优化问题的现有不足,引入Opti-Agent-Bench基准测试,通过业务语义真实性、模块化评估、ORAC双层有效性框架,在多工业规模任务中揭示当前模型关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏