arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-25 至 2026-08-25 共收录 381 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 69 篇

2608.21836 2026-08-25 cs.AI 新提交 79%

LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization

LLM4LLM:通过闭环智能体优化弥合内核基准与实际部署之间的差距

Hui Zeng, Pengfei Yang, Yanxin Chen, Fusong Ju, Xinran Wei

机构 * National Key Laboratory of Advanced Communication Networks(先进通信网络国家重点实验室) Xidian University(西安电子科技大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究人员提出LLM4LLM部署感知闭环优化框架,解决内核基准与实际部署的性能差距,在A100、H100的10个语言模型推理工作负载及KernelBench Level 2上实现显著加速。

Comments accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-25 cs.SE 版本更新 79%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.SE

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.09571 2026-08-25 cs.AI cs.LO math.LO 79%

Measuring the intelligence of an idealized mechanical knowing agent

Samuel Allen Alexander

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments 17 pages, CIFMA 2019

Journal ref Lecture Notes in Computer Science, vol 12226, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-25 cs.CL cs.AI 新提交 79%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22818 2026-08-25 math.OC 新提交 78%

Backward SDE characterization of the finite horizon Principal-Agent problem

有限周期委托代理问题的倒向随机微分方程刻画

Nizar Touzi, Yuxing Huang

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过倒向随机微分方程刻画有限周期委托代理问题的委托人值函数,绕开完全非线性HJB方程,可处理代理人面临机制切换控制的新型委托代理问题。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22400 2026-08-25 cond-mat.mtrl-sci cs.MA 新提交 78%

Diagnosing and narrowing the simulation-to-real gap in powder X-ray diffraction with a wet-dry agentic loop

利用干湿智能体循环诊断并缩小粉末X射线衍射中的模拟到真实差距

Shaoguang Wang, Weiyu Guo, Ben Fei, Xiaohong Shao, Zhihui Wang, Wanli Ouyang

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 该研究针对粉末X射线衍射的模拟到真实差距,提出整合实测图谱微调等技术的Xtalyst智能体系统,通过干湿循环优化,提升了物相分析的准确性与覆盖度。

Comments 72 pages, 15 figures, 7 supplementary tables; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08401 2026-08-25 econ.GN cs.CR q-fin.EC q-fin.ST stat.CO 版本更新 78%

Is Decentralized Finance Actually Decentralized? An Interdisciplinary Framework Integrating Network Theory, Agent-Based Simulation, and Longitudinal Evidence from Aave, GHO Issuance, and Cross-Chain Expansion

去中心化金融真的是去中心化的吗?整合网络理论、基于智能体的模拟以及来自Aave、GHO发行和跨链扩张的纵向证据的跨学科框架

Ziqiao Ao, Lin William Cong, Gergely Horvath, Luyao Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究构建跨学科框架,结合网络理论、智能体模拟与Aave等的纵向数据,发现DeFi的去中心化四维维度会背离,且GHO发行与跨链扩张对DeFi的参与度、集中度影响存在差异,可为相关评估提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20996 2026-08-25 cs.LG cond-mat.mtrl-sci 版本更新 77%

MADE: Benchmark Environments for Closed-Loop Materials Discovery

MADE:用于闭环材料发现的基准环境

Shreshth A Malik, Tiarnan Doherty, Panagiotis Tigas, Muhammed Razzak, Stephen J. Roberts, Aron Walsh, Yarin Gal

机构 * OATML, Department of Computer Science, University of Oxford(OATML,计算机科学系,牛津大学) Diffractive Labs Machine Learning Research Group, Department of Engineering Science, University of Oxford(机器学习研究组,工程科学系,牛津大学) Thomas Young Centre(托马斯·杨中心) Department of Materials, Imperial College London(材料系,伦敦帝国学院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.LG

AI总结 MADE提出了一种闭环材料发现的基准框架,通过模拟受限预算下的材料发现流程,评估发现算法的有效性和效率,并支持灵活的工作流研究。

Comments Poster at ICML 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22432 2026-08-25 cs.CL cs.AI 新提交 73%

Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator

多语言大语言模型评判器中的排名反转:一种无标签双中心化校准器

Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 针对多语言LLM评判器因提示语言导致排名反转的问题,提出无标签共识校准法(CBC),可提升排名一致性及与人工偏好的契合度,验证了其下游实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09819 2026-08-25 cs.LG cs.CL 版本更新 73%

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

Macaron-V1:面向具备自我改进与LoRA混合能力的开放持续学习

Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Aaron Guan, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Echo Lee, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Zhuoran Shen, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Schacter Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Xuening Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang, Mindverse Team

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Macaron-V1开放智能体模型家族,结合MoL架构与递归自我改进机制,经多基准评估验证其有效性,为开放持续学习提供新方案。

Comments 50 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17142 2026-08-25 eess.SY cs.SY 版本更新 71%

A Hybrid Discrete-Event and Agent-Based Simulation Approach to Model Circular Supply Chains in Healthcare: A Case Study of Laparoscopic Scissors

用于建模医疗领域循环供应链的混合离散事件与基于智能体的仿真方法:以腹腔镜剪刀为例

Mohd Shoaib, Antuela Tako, Shahin Rahimifard

专题命中 Agent评测 :agent(title)

AI总结 本文以腹腔镜剪刀供应链为案例,采用混合离散事件与基于智能体的仿真方法,评估医疗领域引入循环医疗器械设计的影响,为医院提供最优库存策略,指出采用循环产品可降低环境影响但需大量前期投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23179 2026-08-25 cs.NI cs.AI 新提交 70%

NetConfArena: An Executable Benchmark for LLM Agents in Closed-Loop Network Configuration

NetConfArena:面向闭环网络配置的LLM智能体可执行基准

Chang Liu, Xiaohui Xie, Xinyi Chen, Yong Cui

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出NetConfArena基准,在仿真多设备网络中评估LLM智能体的闭环网络配置能力,发现其失败不限于命令错误,还存在规范遵守等缺陷,为相关研究指明改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22631 2026-08-25 cs.LG 新提交 70%

Learning Generalizable Behaviors for Terminal Agents

学习终端智能体的可泛化行为

Yihang Yao, Bo Pang, Xuan Phi Nguyen, Ding Zhao, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22618 2026-08-25 cs.LG 新提交 70%

KMGen: A Skill-based Approach for Synthetic Individual Patient Data Generation

KMGen:一种基于技能的合成个体患者数据生成方法

Jalen Jiang, Chufan Gao, Ethan Rasmussen, Stephen Z. Xie, Jimeng Sun

机构 * Mayo Clinic Alix School of Medicine(梅奥诊所阿利克斯医学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 KMGen是首个端到端框架,可全自动提取KM曲线并生成合成患者不良事件轨迹,在多肿瘤试验中精度达标,相关流水线已开源。

Journal ref Proceedings of Machine Learning Research 340 (2026) 1-60

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22610 2026-08-25 cs.AI 新提交 70%

Coalition-Aware Skill Reliability for Self-Evolving Agents

面向自进化智能体的联盟感知技能可靠性

Qiyan Zhao, Xiaofeng Zhang, Bo Liu, Minda Chen, Wei Xiong, Jingyang Chen, Guanting Ye, Wenhao Yu, Xiaosong Yuan, Shijie Han, Da-Han Wang, Jianmin Ji, Fei Huang, Xu-Yao Zhang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对自进化智能体技能库的可靠性问题,提出CASS与u-SMCO两类干预措施,在多数据集上提升了任务性能与跨域泛化能力,还降低了强化学习对噪声奖励的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11234 2026-08-25 cs.AI cs.OS 版本更新 70%

InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

InfraBench:评估跨层级、全生命周期与风险的基础设施智能体

Yuan Gao, Zeren Yang, Junnan Li, Shawn, Zhong, Ahmed Dajani, Mai Zheng, Andrea Arpaci-Dusseau, Remzi Arpaci-Dusseau

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Iowa State University(爱荷华州立大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 针对AI智能体应对真实基础设施复杂度能力不明的问题,提出跨全系统栈、全生命周期且支持细粒度风险评估的InfraBench基准套件,实验表明现有最强智能体仍存在多方面失败模式。

Comments 17 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08169 2026-08-25 cs.AI 版本更新 70%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23440 2026-08-25 eess.SY cs.SY 新提交 67%

Temporal Property-driven Design Space Exploration with Reinforcement Learning for Cyber-Physical Systems

面向网络物理系统的、基于时间属性驱动的强化学习设计空间探索

Tagir Fabarisov, Maxime Cordy

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 该研究针对网络物理系统设计空间探索的难题,提出基于强化学习的时间属性驱动工作流,在矿用泵CPS案例中,其引导搜索需更少仿真次数即可找到最优设计。

Comments Accepted manuscript for IECON 2026 - 52nd Annual Conference of the IEEE Industrial Electronics Society, Doha, Qatar, 18-21 October 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20169 2026-08-25 cs.CL cs.AI cs.LG 版本更新 67%

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化

Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Task-CoEvolve通过自适应验证任务选择,使LLM智能体框架与验证任务协同演化,在保持全集搜索最终性能的同时,减少80%评估次数,实现高效的智能体框架优化。

Comments v2: Fix typo in v1, Github: https://github.com/Agent4Science-UTokyo/Task-CoEvolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04448 2026-08-25 cs.AI cs.CL cs.CV cs.LG cs.MA 版本更新 67%

SkillNet: Create, Evaluate, and Connect AI Skills

SkillNet: 创建、评估和连接AI技能

Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Yida Xue, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tongji University(同济大学) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) Tencent(腾讯) Fudan University(复旦大学) The University of Edinburgh(爱丁堡大学) Monash University(墨尔本大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huzhou University(湖州大学) Hornor Device Co., Ltd(Hornor设备有限公司) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。

Comments http://skillnet.openkg.cn/; add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22852 2026-08-25 cs.AI cs.CL q-fin.GN 新提交 62%

Your AI, On a Dial: Controlling Investment Bias in LLMs with a Single Neuron

你的AI,可调节的旋钮:用单个神经元控制大语言模型的投资偏差

Sahong Park, Suhwan Park, Hoyoung Lee, Gakyung Kwon, Wonbin Ahn, Jaewon Choi, Alejandro Lopez-Lira, Yoon Kim, Chanyeol Choi, Hyeongwoo Kong, Yongjae Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) UNIST(蔚山科学技术院) LG AI Research(LG AI研究院) Hanwha Life(韩华生命保险) University of Florida(佛罗里达大学) Massachusetts Institute of Technology(麻省理工学院) LinqAlpha

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出投资偏差旋钮这一推理时单个神经元干预方法,可在不修改提示或参数的情况下,稳定校准LLM的整体投资立场,且适用于不同场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22830 2026-08-25 cs.AI cs.LG 新提交 62%

Beyond the Harness: End-to-End Optimization of Context Artifacts for Enterprise Text-to-SQL

超越框架:面向企业文本转SQL的上下文构件端到端优化

Kate Gwimm, Carson Eisenach

机构 * Amazon(亚马逊公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对企业文本转SQL任务的上下文瓶颈,本文提出从历史查询生成可复用SQL参考卡片的端到端优化方法,在生产查询基准上取得显著优于优化检索框架的提升,在BEAVER基准上也实现了有效改进。

Journal ref COLM 2026 Workshop - Context Beyond the Window

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22266 2026-08-25 cs.AI cs.CL 新提交 62%

Clarify User Expertise: Towards Proactive Conversational Agents Tailoring Responses to User Proficiency

明确用户专业能力:面向可根据用户熟练度调整响应的主动式对话智能体

Zhihong Cao, Chen Huang

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对现有对话智能体无法仅通过查询判断用户专业能力的缺陷,提出PASSING方法,通过LLM自博弈生成的询问策略主动明确用户专业能力,以调整响应提升用户理解,实验显示该方法具有优越性。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22108 2026-08-25 cs.AI cs.LG 新提交 62%

Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings

用于乳腺癌多学科团队会议的边缘人工智能医疗设备系统的开发与可行性评估

Aarzoo Dhiman, Farzana Haque, Kartikae Grover, Lydia Brian Smith, William Stephen Jones

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了基于边缘AI的乳腺癌MDT会议系统,利用开源ASR、LLM和RAG实现设备上运行,经评估其ASR与RAG性能优异,证明了该系统的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-08-25 cs.AI cs.CL 版本更新 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, Bernard Ghanem, David R. Pugh

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23262 2026-08-25 cs.AI 版本更新 61%

Designing Benchmarks for Knowledge Work

知识工作的设计与报告基准

Yining Hua, Hongbin Na, Cyrus Ayubcha, Levi Lian

机构 * Harvard University(哈佛大学) University of Technology Sydney(悉尼科技大学) Stanford University(斯坦福大学) Raycaster AI

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI;agent(comments)

AI总结 针对当前知识工作评估基准与真实部署脱节的问题,提出三步法(定义工作活动、指定测试设置、评分工作产品)来明确基准任务与工作主张的对应关系,并通过三个案例分析展示设计选择如何影响可支持的工作主张。

Comments 18 pages. This replacement updates the title and revises the contribution from a three-step reporting approach to a four-field work-centered benchmark representation (represented activity, tested setting, required work product, and evaluated result). Author affiliations now include Agent Evaluation Science, Inc., New York, NY 10001

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23525 2026-08-25 cs.AI 新提交 57%

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试

Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao

机构 * NUIST(南京信息工程大学) HKU(香港大学) McGill(麦吉尔大学) HKUST(GZ)(香港科技大学(广州)) Georgia Tech(佐治亚理工学院) NUS(新加坡国立大学) Tsinghua(清华大学) Griffith(格里菲斯大学) UT Austin(德克萨斯大学奥斯汀分校) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23435 2026-08-25 cs.CV cs.AI 新提交 57%

Towards Comprehensive Basketball Understanding

迈向全面的篮球理解

Yirong Hu, Jiayuan Rao, Yu Zhang, Shangzhe Di, Weidi Xie

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有篮球理解基准仅单一评估能力的不足,构建多模态基准BasketballBench,并提出智能体BasketballSkills,实验显示其在整合多能力的篮球理解任务上优于现有MLLM。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22729 2026-08-25 cs.LG cs.NE 新提交 57%

Spiking Neural Networks for Continuous Control: Neuromorphic Reinforcement Learning in Conventional Computing

用于连续控制的脉冲神经网络:传统计算中的神经形态强化学习

Jessica Hunter, Md Maruf Hossain Shuvo, Krishna Roy

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业技术学院) The University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究提出SANSAC算法,在传统硬件上验证其性能与SAC近乎相当,证明基于脉冲神经网络的算法可用于复杂连续环境,为神经形态强化学习研究奠定了基础。

Journal ref ICLR 2026 2nd Workshop on World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22606 2026-08-25 cs.LG 新提交 57%

Adversarial Agents on Topology Optimization: Understanding the Fragility and Robustness of Deep Learning-based and Physics-Based Design Models under Adversarial Perturbation

拓扑优化上的对抗智能体:理解基于深度学习与基于物理的设计模型在对抗扰动下的脆弱性与鲁棒性

Hoang Anh Nguyen, Yuan Hong, Hongyi Xu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究构建力学驱动的对抗智能体评估拓扑优化中深度学习代理模型的脆弱性,发现初始噪声会引发机械失效,物理梯度调节未必提升鲁棒性,SIMP优化器可部分恢复性能,为鲁棒生成式设计智能体训练提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏