arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-02 至 2026-06-02 共收录 425 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 18 篇

2606.01640 2026-06-02 cs.AI cs.CL 84%

MobEvolve: An Agentic Self-Evolving Heuristic System for Interpretable Human Mobility Generation

MobEvolve:用于可解释人类移动性生成的智能体自进化启发式系统

Junlin He, Yihong Tang, Tong Nie, Ao Qu, Yuebing Liang, Hamzeh Alizadeh, Bang Liu, Wei Ma, Lijun Sun

机构 * The Hong Kong Polytechnic University(香港理工大学) McGill University(麦吉尔大学) MIT(麻省理工学院) Tsinghua University(清华大学) Autorité régionale de transport métropolitain(大都会交通地区管理局) Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MobEvolve,首个智能体自进化启发式框架,通过LLM代理迭代演化内部逻辑,在保持可解释性和推理效率的同时,在个体轨迹保真度、群体分布对齐和行为合理性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01528 2026-06-02 cs.AI 83%

Joint Agent Memory and Exploration Learning via Novelty Signals

通过新颖性信号实现联合智能体记忆与探索学习

Shizuo Tian, Xiaohong Weng, Rui Kong, Yuxuan Chen, Guohong Liu, Yuebing Song, Jiacheng Liu, Yuchen Li, Dawei Yin, Ting Cao, Yunxin Liu, Yuanchun Li

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司) Tongji University(同济大学) Peking University(北京大学)

专题命中 记忆与上下文管理 :agent(title);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出JAMEL框架,利用新颖性信号联合训练智能体记忆与探索策略,在开放环境中实现高效探索并泛化到未见环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29341 2026-06-02 cs.CV cs.CL 83%

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

WorldMemArena: 通过动作-世界交互评估多模态智能体记忆

Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) J.P. Morgan Chase(摩根大通) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26197 2026-06-02 cs.IR cs.LG 79%

Hierarchical Long-Term Semantic Memory for LinkedIn's Hiring Agent

面向LinkedIn招聘代理的分层长期语义记忆

Zhentao Xu, Shangjin Zhang, Emir Poyraz, Yvonne Li, Ye Jin, Xie Lu, Xiaoyang Gu, Karthik Ramgopal, Praveen Kumar Bodigutla, Xiaofeng Wang

机构 * LinkedIn Corporation(LinkedIn公司)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.LG

AI总结 提出分层长期语义记忆(HLTM)框架,通过构建模式对齐的记忆树,实现可扩展的语义知识摄入、隐私感知存储、低延迟检索和透明溯源,在LinkedIn招聘助手应用中使答案正确率提升超5%、检索F1提升超10%。

Comments Accepted to the Applied Data Science (ADS) track at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03588 2026-06-02 cs.AI 79%

Rashomon Memory: Towards Argumentation-Driven Retrieval for Multi-Perspective Agent Memory

Rashomon记忆:面向多视角智能体记忆的论证驱动检索

Albert Sadowski, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 记忆与上下文管理 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 提出Rashomon记忆架构,通过并行目标条件化智能体以各自优先级编码经验,并在查询时通过论证协商,利用Dung的论证语义选择解释,支持冲突呈现模式。

Comments Presented at EXTRAAMAS workshop at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17921 2026-06-02 cs.CV 71%

An Efficient Streaming Video Understanding Framework with Agentic Control

一种具有代理控制的高效流式视频理解框架

Jinming Liu, Jianguo Huang, Zhaoyang Jia, Jiahao Li, Xiaoyi Zhang, Zongyu Guo, Bin Li, Wenjun Zeng, Yan Lu, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo, China(宁波工程技术学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 记忆与上下文管理 :agentic(title)

AI总结 提出R3-Streaming框架,通过级联控制(记忆压缩、响应判断、计算路由)和年龄感知遗忘策略及目标平衡强化学习(TB-GRPO),在严格延迟预算下实现流式视频理解,性能达到SOTA并减少95-96%视觉令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26169 2026-06-02 cs.SE cs.LO 70%

ESBMC: A Survey of Its Evolution, Integration, and Future Directions in Formal Software Verification

ESBMC:形式化软件验证的演化、集成与未来方向综述

Pierre Dantas, Lucas Cordeiro, Waldir Junior

专题命中 记忆与上下文管理 :AI agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文综述了ESBMC从研究原型发展为工业级形式化验证平台的过程,涵盖其技术演进、语言支持扩展、与LLM及AI代理的集成,并总结了其获奖、经济影响及未来挑战。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01053 2026-06-02 cs.LG 70%

LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents

LRAgent: 面向多LoRA LLM代理的高效KV缓存共享

Hyesung Jeon, Hyeongju Ha, Jae-Joon Kim

机构 * KAIST(韩国科学技术院)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 针对多LoRA代理系统中每个代理独立存储相同长轨迹的KV缓存导致内存和计算开销大的问题,提出LRAgent框架,通过将缓存分解为共享基座部分和适配器依赖部分,并利用共享A的多LoRA架构和Flash-LoRA-Attention内核,实现高效共享,在保持精度的同时显著降低开销。

Comments 25 pages, 10 figures, 22 tables

Journal ref ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02373 2026-06-02 cs.AI cs.CL cs.IR 62%

Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses

Harness-1:基于状态外化马具的搜索智能体强化学习

Pengcheng Jiang, Zhiyi Shi, Kelly Hong, Xueqiang Xu, Jiashuo Sun, Jimeng Sun, Hammad Bashir, Jiawei Han

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Harness-1,一个20B参数的搜索智能体,通过强化学习在有状态搜索马具中训练,将常规状态管理外化到环境,在八个检索基准上平均召回率0.730,超越现有开源搜索子智能体11.4个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00506 2026-06-02 cs.AI cs.LG 62%

EnergyMamba: An Uncertainty-Aware Graph-Enhanced Selective State Space Model for Energy Consumption Prediction

EnergyMamba:一种用于能耗预测的具有不确定性感知的图增强选择性状态空间模型

Dahai Yu, Rongchao Xu, Lin Jiang, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出EnergyMamba框架,通过图增强选择性状态空间模型(GE-Mamba)和自适应序列分位数回归(AS-CQR)模块,实现时空联合建模与不确定性量化,在能耗预测中提升准确率约5%、不确定性量化约6%。

Comments Accepted by KDD 2026 AI4S

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00547 2026-06-02 cs.CL 57%

Learning to Retrieve: Dual-Level Long-Term Memory for Text-to-SQL Agents

学习检索:面向文本到SQL代理的双层长期记忆

Yibo Wang, Nikki Lijing Kuang, Philip S. Yu, Zhewei Yao, Yuxiong He

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Snowflake AI Research(Snowflake AI研究院)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.CL

AI总结 提出MERIT框架,通过强化学习优化双层记忆检索(全局策略与局部决策),提升交互式文本到SQL代理的成功率并减少交互轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00289 2026-06-02 cs.LG cs.DS 57%

Inner Product Aware Quantization: Provably Fast, Accurate, and Adaptive Algorithms

内积感知量化:可证明快速、准确且自适应的算法

Nathan White, Krish Singal

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 记忆与上下文管理 :tool use(abstract);分类 cs.LG

AI总结 本文提出内积感知量化方法,通过优化目标函数并利用自适应随机量化(ASQ)理论,开发出快速且无偏的量化算法,在保证质量的同时比现有方法快2-10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09692 2026-06-02 cs.AI 57%

Causal state binding predicts action control in language agents

因果状态绑定预测语言智能体中的动作控制

Xiao Jia

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳))

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出因果状态绑定框架,通过干预实验测量智能体动作是否随事件特定决定性状态变化,验证了结构化智能体在动作控制上优于随机基线。

Comments 85 pages, 5 main figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31557 2026-06-02 cs.CV 50%

EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision

EGOSTREAM: 面向第一人称视角的流式情景记忆诊断基准

Rosario Forte, Giuseppe Lando, Antonino Furnari

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) University of Catania(卡塔尼亚大学)

专题命中 记忆与上下文管理 :autonomous agent(abstract)

AI总结 提出EGOSTREAM基准,通过七种认知维度和答案有效期窗口,诊断流式视频中模型的情景记忆能力,并评估多种记忆管理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05033 2026-06-02 cs.RO cs.CV 50%

CloSE: A Geometric Shape-Agnostic Cloth State Representation

CloSE: 一种几何形状无关的布料状态表示

Jay Kamat, Júlia Borràs, Carme Torras

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(西班牙工业机器人与信息技术研究所,CSIC-UPC)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 提出一种基于拓扑索引的dGLI圆盘表示,并从中抽象出紧凑、连续的CloSE表示,用于预测布料折叠位置并支持语义标注与规划。

Comments Accepted at ICRA 2026 (8 pages, 11 figures, 1 table). Project page: https://close-representation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 74 篇

2606.01725 2026-06-02 cs.AI cs.LG 91%

Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation

基于迹驱动仿真的通用任务多模型智能体AI系统特征分析

Donghwan Kim, Prakhar Singh, Younghoon Min, Jongryool Kim, Jongse Park, Kiwan Maeng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) SK Hynix(SK海力士) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(summary_cn,abstract);agentic(title,abstract);tool use(abstract);planning(abstract)

AI总结 本文提出GAIATrace数据集和Vidur-Agent仿真器,通过迹驱动仿真分析多模型智能体AI系统在通用任务上的行为特征。

Comments 13 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05871 2026-06-02 cs.AI 90%

Agent Guide: A Simple Agent Behavioral Watermarking Framework

Agent Guide:一种简单的智能体行为水印框架

Kaibo Huang, Zipei Zhang, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 针对智能体行为难以标记和转换的问题,提出Agent Guide框架,通过概率偏差引导智能体高层决策嵌入水印,并利用z统计量检测,实现低误报率的水印嵌入与提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14355 2026-06-02 cs.AI cs.CL 88%

Herculean: An Agentic Benchmark for Financial Intelligence

Herculean: 面向金融智能的智能体基准测试

Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yilun Zhao, Youzhong Dong, Xiaoyu Wang, Yankai Chen, Ye Yuan, Qiyuan Zhang, Fuyuan Lyu, Haolun Wu, Yonghan Yang, Zichen Zhao, Yuyang Dai, Fan Zhang, Rania Elbadry, Ayesha Gull, Muhammad Usman Safder, Nuo Chen, Fengbin Zhu, Tianshi Cai, Zimu Wang, Polydoros Giannouris, Yuechen Jiang, Zhiwei Liu, Mohsinul Kabir, Yuyan Wang, Yixiang Zheng, Yangyang Yu, Weijin Liu, Wenbo Cao, Anke Xu, Peng Lu, Jerry Huang, Mingquan Lin, Prayag Tiwari, Yijia Zhao, Víctor Gutiérrez-Basulto, Xiao-Yang Liu, Kaleb E Smith, Jiahuan Pei, Arman Cohan, Jimin Huang, Yuehua Tang, Alejandro Lopez-Lira, Xi Chen, Xue Liu, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou

机构 * The Fin AI Yale University(耶鲁大学) Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) NVIDIA(英伟达) New York University(纽约大学) Georgia Institute of Technology(佐治亚理工学院) University of Florida(佛罗里达大学) MBZUAI Université de Montréal(蒙特利尔大学) University of Minnesota(明尼苏达大学) University of Massachusetts Boston(马萨诸塞大学波士顿分校) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) University of Liverpool(利物浦大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) National University of Singapore(新加坡国立大学) Halmstad University(哈尔姆斯塔德大学) University of Manchester(曼彻斯特大学) Cardiff University(卡迪夫大学) McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文提出Herculean,首个覆盖交易、对冲、市场洞察和审计四个代表性工作流的智能体金融智能基准测试,通过标准化MCP技能环境评估异构智能体系统,发现智能体在交易和市场洞察上表现较好,但在对冲和审计等需要长期协调、状态一致性和结构化验证的任务上存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16310 2026-06-02 cs.CR cs.AI cs.CL 88%

Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation

Agent工具编排泄露更多:数据集、基准测试与缓解措施

Yuxuan Qiao, Dongqin Liu, Hongchang Yang, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 Agent评测 :agent(title,title_cn);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究LLM代理在编排多个工具时泄露敏感结论的风险(TOP-R),构建了包含1000个实例的基准TOP-Bench,并提出TOP-Align后训练方法以缓解泄露。

Comments 17 pages, 2 figures. Dataset and code are available at https://github.com/1Ponder/TOP-R

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00829 2026-06-02 cs.CL cs.AI cs.LG 88%

Constitutional Black-Box Monitoring for Scheming in LLM Agents

LLM Agent 中阴谋行为的宪法黑盒监控

Simon Storf, Rich Barton-Cooper, James Peters-Gill, Marius Hobbhahn

机构 * University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(title_cn,summary_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 研究使用基于宪法黑盒的监控器,通过仅观察外部输入和输出检测LLM Agent的阴谋行为,并在合成数据上优化后泛化到更真实环境。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01816 2026-06-02 q-bio.BM cs.LG 87%

Site4Drug: Predicting Drug-Binding Target Sites with an AI Agent

Site4Drug: 利用AI智能体预测药物结合靶点

Taehan Kim, Sarrah Rose Mikhail Leung, Bharat Mekala, Jeongbin Park

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.LG;agentic(comments)

AI总结 提出Site4Drug,一种模态感知的靶点发现智能体,通过整合拓扑、亲水性、翻译后修饰等证据,输出带约束、风险标记和决策日志的可靶向区域排名列表,并自动推荐结合模态。

Comments Accepted to the ICML 2026 Workshop on Generative and Agentic AI for Biology (GenBio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00931 2026-06-02 cs.CV cs.AI 86%

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好

Fangzhou Lin, Peiran Li, Lingyu Xu, Wenjing Chen, Qianwen Ge, Shuo Xing, Mingyang Wu, Xiangbo Gao, Siyuan Yang, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhen Dong, Ming-Hsuan Yang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达) UCSB(加州大学圣塔芭芭拉分校) UC Merced(加州大学默塞德分校)

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。

Comments 26 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00915 2026-06-02 physics.optics 86%

Autonomous agentic design for photonics

光子学的自主智能体设计

Prashanta Kharel, Amin Khavasi, Xinzhong Chen, Tyler W. Hughes

专题命中 Agent评测 :autonomous agent(title);agentic(title);agent(abstract)

AI总结 提出一种基于大型语言模型的自主智能体方法,通过自动设计循环(提出、模拟、评估、迭代)实现光子器件的高性能设计,并成功应用于无源、有源、射频及芯片布局四类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01434 2026-06-02 cs.CL 85%

DrugClaw and DrugAudit: A Primary-Source-Grounded Agent and Authority-Aware Benchmark for Drug-Information Question Answering

DrugClaw与DrugAudit:基于原始来源的智能体与权威感知基准用于药物信息问答

Qing Wang, Bo Li, Jialu Liang, Daling Shi, Bob Zhang, Qianqian Song

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学健康结局与生物医学信息学系,医学院) PAMI Research Group, Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院计算机与信息科学系PAMI研究组)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);multi-agent(abstract);分类 cs.CL

AI总结 提出多智能体检索增强系统DrugClaw,通过反射驱动状态机查询药物注册与药物警戒知识库,并构建含3772条权威感知基准DrugAudit,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00750 2026-06-02 cs.CL 84%

I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications

I-WebGenBench: 评估大语言模型生成的科学网页应用中的交互性

Dasen Dai, Biao Wu, Meng Fang, Shuoqi Li, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS University of Liverpool(利物浦大学)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);tool use(abstract);分类 cs.CL

AI总结 提出 Paper-to-Interactive-System Agent 将研究论文转化为可执行交互式网页系统,并构建 PaperVoyager 框架以显式建模机制和交互逻辑,显著提升生成质量。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01498 2026-06-02 cs.CL cs.AI 84%

TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

TimeSage-MT:用于评估智能时间序列推理的多轮基准测试

Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen

机构 * University of Oxford(牛津大学) VulpiVox Intelligence Eindhoven University of Technology(埃因霍温理工大学) Griffith University(格里菲斯大学) Squirrel Ai Learning East China Normal University(华东师范大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出TimeSage-MT多轮基准测试,包含240个任务和2680轮对话,覆盖8个真实领域,用于评估LLM智能体在时间序列推理中的表现,揭示其在决策导向任务中的性能下降及记忆、不确定性处理等缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00448 2026-06-02 cs.SE cs.AI cs.CR 84%

When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems

当安全技能碰撞:衡量智能体技能生态系统中的组合风险

Su Wang, Pin Qian, Yihang Chen, Junxian You, Xiaoyuan Wang, Xiaochong Jiang, Lifei Liu, Haoran Yu, Jingzhou Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) University of Glasgow(格拉斯哥大学) Independent Researcher(独立研究员) Corespeed Inc.(Corespeed公司)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SkillReact框架,通过静态组合基准、双评分者LLM辅助人工审核和基于动作的可利用性测试,研究LLM智能体中个体安全的技能组合后可能产生的不安全行为,发现约18.2%的候选组合存在真实风险,且主机模型决定是否利用这些组合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00189 2026-06-02 cs.LG cs.AI 84%

Learning to Construct Practical Agentic Systems

学习构建实用的智能体系统

Aditya Kumar, Zhihan Lei, Jerry Yan, Joshua W. Momo, Lauhitya Reddy, Rafael Enrique Cabrera Jimenez, Cassandra A. Cohen, Arthur Kajiyama, William W. Cohen

机构 * Carnegie Mellon University(卡内基梅隆大学) Dept. of Computer Science(计算机科学系) Emory University(埃默里大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于伪工具和固定工作流的智能体框架,通过模块化设计和多目标优化方法,在保证成本可控和结果质量的前提下,实现实用智能体系统的自动构建与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16953 2026-06-02 cs.AI cs.LG 84%

LLM4Cov: Execution-Aware Agentic Learning for High-coverage Testbench Generation

LLM4Cov:面向高覆盖率测试生成的执行感知智能体学习

Hejia Zhang, Zhongming Yu, Chia-Tung Ho, Haoxing Ren, Brucek Khailany, Jishen Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LLM4Cov离线智能体学习框架,通过执行验证数据策展、策略感知数据合成和最差状态优先采样,在硬件验证中实现高覆盖率测试生成,4B参数模型在CVDP-ECov上达到69.2%通过率和90.4%平均覆盖率。

Comments ICML'26 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02404 2026-06-02 cs.CL 83%

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

K-BrowseComp:基于韩国语境的网页浏览代理基准测试

Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

机构 * Chung-Ang University(Chung-Ang 大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) OnelineAI NAVER Cloud AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 针对韩国语境,构建包含400个问题的网页浏览代理基准K-BrowseComp,评估前沿模型性能,发现其准确率显著低于BrowseComp,并公开数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏