arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-24 至 2026-08-24 共收录 38 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 38 篇

2608.20614 2026-08-24 cs.AI 新提交 90%

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills

评估技能,而非仅评估智能体:智能体驱动的技能持续评估

Christopher Kevin, Narendran Raghavan, Jean-Francois Puget, Roshni Malani, Meghana Puvvadi, Moshe Abramovitch, Mohit Gupta, Rama Akkiraju, Subodh Prabhu, Yogesh Dangi, Wei Luo, Seong Hee Lee

机构 * NVIDIA(英伟达)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);tool use(abstract);workflow(abstract)

AI总结 该研究提出ACES框架,通过配对实际 trials等方式评估技能附加价值,实验表明其能发现扫描式审核无法观测的信号,开源实现已在NVIDIA SkillEvaluator中提供。

Comments 15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: this https URL (https://github.com/NVIDIA/SkillEvaluator)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20903 2026-08-24 cs.SE 新提交 87%

Generation of Web Apps with Agentic IDEs: An Empirical Assessment

智能体集成开发环境(Agentic IDE)生成网页应用:一项实证评估

Manuel Marceca, Maria Teresa Rossi, Leonardo Mariani

专题命中 Agent评测 :agentic(title,title_cn);分类 cs.SE

AI总结 本文通过对比Copilot、Cursor、Windsurf三款智能体IDE生成五个全栈网页应用的表现,发现其在生成常见模式时成熟度高,但生成分布式架构错误多,无法替代开发者,仅能辅助开发者构建软件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06607 2026-08-24 cs.CR 版本更新 87%

Your Harness is Not Secure: Benchmarking Real-world Threat of Command Line Interface Agent

你的工具不安全:评测命令行界面智能体的现实威胁

Weidi Luo, Qiming Zhang, Tianyu Lu, Xiaogeng Liu, Bin Hu, Hung-Chun Chiu, Siyuan Ma, Yizhe Zhang, Xusheng Xiao, Yinzhi Cao, Zhen Xiang, Chaowei Xiao

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract,abstract_cn)

AI总结 该研究针对CLI智能体滥用风险,推出与MITRE ATT&CK对齐的AdvCLI基准测试,评估7款CLI智能体后发现其常越过拒绝边界,可完成部分恶意OS级任务,为开发安全机制提供测试平台。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20851 2026-08-24 cs.SE cs.AI 新提交 86%

BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP

BC-Bench:在ERP领域特定语言中评估智能体工程

Haoran Sun, Klaus Marius Hansen

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 该研究推出BC-Bench基准,评估智能体工程在ERP领域DSL(AL)上的表现,发现通用基准的改进未一致迁移到AL,凸显领域特定评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21057 2026-08-24 cs.LG 新提交 83%

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

通过人类对齐设计用于药物发现中智能体AI的鲁棒性大语言模型评估系统

Emma Granqvist, Rocío Mercado, Samuel Genheden

机构 * AstraZeneca(阿斯利康) Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Science for Life Laboratory (SciLifeLab)(生命科学实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本研究针对药物发现智能体AI,提出人类对齐的LLM作为评判者评估框架,优化后对齐度达0.86,为科学领域智能体系统评估提供可复用模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20688 2026-08-24 cs.AI physics.optics 新提交 83%

VortexChat: An agentic framework for autonomous multi-objective integrated photonic design

VortexChat:面向自主多目标集成光子设计的智能体框架

Faqian Chong, Yulun Wu, Shilong Li, Andrew Forbes, Hongsheng Chen, Song Han

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 VortexChat是结合LLM决策智能体与电磁仿真的自主设计框架,可从自然语言规格端到端设计集成光子器件,在Vortex100基准测试中无需人工介入即可生成达标器件,成功设计制备出高性能太赫兹涡旋光束复用器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21095 2026-08-24 cs.SE cs.AI cs.CL cs.CR cs.IR 新提交 82%

Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems

可信检索增强生成:用于检测生成式人工智能系统中错误信息和知识投毒的评估智能体

Balkrishna Giri, Md Toufique Hasan, Jussi Rasku, Muhammad Waseem, Pekka Abrahamsson

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 该研究针对RAG系统的安全-可靠性鸿沟,提出结合NLI验证、五信号投毒检测器及可信指数的评估智能体,在TruthfulQA等数据集上实现高检测性能,可阻止RAG系统的不安全指令注入。

Comments 7 pages, 1 figure. Accepted for publication in the Main Research Track of the Twenty-First International Conference on Software Engineering Advances (ICSEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20634 2026-08-24 cs.CL cs.AI 新提交 81%

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale

AgentMercury:你的智能体可规模化合成面向业务场景的可验证环境

Minbyul Jeong, Chanwoong Yoon

机构 * Meridian Intelligence Global Inc.(子午线智能全球公司) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 Agent评测 :agent(title);tool use(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出AgentMercury框架,可规模化合成业务场景的可执行环境,经其训练的智能体策略在企业工作流及多领域基准上表现提升,且环境构建过程可通过微调学习优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20627 2026-08-24 cs.CL cs.AI 新提交 81%

When Failures Propagate: Causal Failure Attribution in Agentic Retrieval-Augmented Generation

当故障传播时:智能体检索增强生成中的因果故障归因

Lauren Pothuru

机构 * Anote(阿诺特)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出AgenticRAG-FP基准,针对智能体RAG的因果故障归因开展实验,发现基于覆盖率的诊断在第1轮表现较好,第2、3轮较差,明确将传播深度作为相关评估维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20597 2026-08-24 cs.SE cs.AI cs.CY 新提交 81%

Testing and Evaluation of Agentic AI Systems In Military Command and Control

面向军事指挥与控制的智能体AI系统的测试与评估

Ulysse Richard, Heather Frase, Sarah Cao, Di Cooke, Sebastian Kwon, Adrianna Tan

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文针对军事C2场景中智能体AI系统测试与评估的保障问题,分析既定方法的假设被智能体特性削弱的情况,推导保障主张并评估现有方法,明确部分举证责任转移至部署阶段。

Comments 57 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20485 2026-08-24 cs.AI cs.SE 新提交 81%

Terminal Agents: A Survey of AI Agents in Command-Line Environments

终端智能体:命令行环境下的AI智能体综述

Yi Bin, Xiaoyang Yuan, Haoxi Zeng, Wencheng Ye, Wenqi Shao, Chen Qian, Wei Ye, Yujuan Ding, Zheng Wang, Pengpeng Zeng, Jingkuan Song, Heng Tao Shen

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学)

专题命中 Agent评测 :AI agent(title);tool use(abstract);分类 cs.AI、cs.SE

AI总结 本文将终端智能体定义为行动-观察循环由终端介导的系统,通过七维轮廓关联架构等模块,揭示其行为影响因素与评估不均衡问题,为相关研究提供统一框架。

Comments 52 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21140 2026-08-24 cs.CV cs.AI 新提交 79%

A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans

用于CT扫描中可靠且可审计的空间关系验证的模块化智能体

Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur, Daniel Santak Wolf

机构 * Ulm University(乌尔姆大学) Ulm University Hospital(乌尔姆大学医院) Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21049 2026-08-24 cs.CR cs.AI cs.NI 新提交 79%

$Z^2$-ACT: End-to-End Verifiable Agentic Intent Control for Open 6G RAN

$Z^2$-ACT:面向开放6G无线接入网的端到端可验证智能体意图控制

Sunder Ali Khowaja, Kapal Dev, George C. Alexandropoulos

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对开放6G RAN多厂商部署的安全可验证需求,提出$Z^2$-ACT架构,集成多类核心组件并经实验验证其执行过滤与攻击恢复能力提升。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20438 2026-08-24 physics.soc-ph cs.AI cs.MA cs.SI 新提交 79%

Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources

同行投票的大语言模型智能体压力测试:发现feed诱导的词汇趋同,但分布式来源无可靠的匹配暴露优势

Rana Muhammad Usman, Dominic Williamson

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究通过PV-SST测试床开展实验,发现同行排名feed会诱导LLM智能体群体的词汇趋同,但未证实分布式来源相比单一来源具有可靠的立场改变优势。

Comments 9 pages, 3 figures. Code, frozen protocol, configurations, summary tables, and data are publicly available at this https URL (https://github.com/ranausmanai/synthetic-social-networks) and this https URL (https://huggingface.co/datasets/ranausmans/synthetic-social-networks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20996 2026-08-24 math.OC 新提交 78%

Bridging Semantics and Behavior: An Agent-Based Evolutionary Model of Topic Competition with BERTopic

衔接语义与行为:基于智能体的BERTopic主题竞争演化模型

Blekanov I., Gubar E., Fan X

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究提出结合BERTopic、演化博弈论与智能体模拟的框架,揭示社交媒体主题传播的微观机制,复现真实传播趋势,为在线集体行为研究及相关应用提供支撑。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20376 2026-08-24 cs.CL cs.LG 新提交 76%

TH-GNN: Heterogeneous Temporal Graph Neural Networks for LLM-Agent Shilling Attack Detection

TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络

Shivam Swarup, Divya Prakash Shrivastava, Rakesh Thakur

机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) Zayed University(扎耶德大学)

专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG

AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20432 2026-08-24 cs.LO cs.AI cs.CL 新提交 73%

ProofJudge: Tool-Grounded LLM Evaluation of Formal Proof Quality in Mathlib

ProofJudge:基于工具的大语言模型(LLM)对Mathlib中形式化证明质量的评估工具

Shane Caldwell

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出ProofJudge系统,通过智能体式LLM从五个维度评估Mathlib形式化证明质量,在218个声明数据集上验证其与人类偏好对齐度,发布开源制品支持相关研究。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20349 2026-08-24 cs.CL cs.AI 新提交 73%

Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on Quality

提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析

Qipeng Xie, Zi Liang, Jiafei Wu, Yufei Chen, Weizheng Wang, Wenao Ma, Zhong Ming, Haiqin Yang, Kaishun Wu

机构 * Shenzhen Technology University(深圳技术大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang Lab(之江实验室) The Chinese University of Hong Kong(香港中文大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21209 2026-08-24 cs.AI cs.CL cs.LG 新提交 67%

Personalized Privacy Control in LLMs via Attention Head Intervention

基于注意力头干预的大语言模型个性化隐私控制

Junseok Kim, Nakyeong Yang, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对大语言模型隐私控制的用户偏好差异问题,提出个性化隐私概念及P3Bench基准,发现提示策略执行效果差,进而提出Repair方法提升隐私策略依从性

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18250 2026-08-24 cs.CV 版本更新 67%

Future Dynamic 3D Reconstruction: Toward 3D World Modeling with Disentangled Ego-Motion

未来动态3D重建:一种具有解耦自运动的3D世界模型

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。

Comments ICML 2026. Project page: this https URL (https://fr3d-wm.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21107 2026-08-24 cs.AI cs.SE 新提交 62%

Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda

大型语言模型在软件工程与软件安全交叉领域:一项以证据为中心的结构化调查与研究议程

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究调查了LLMs在软件工程与软件安全交叉领域的进展,提出保证框架,识别有效性威胁与最低报告协议,制定研究议程,主张以任务适配证据而非单一基准评判模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20622 2026-08-24 cs.AI cs.SE 新提交 62%

Applying Anthropic Primitives at Large Enterprises: Harness Paradigm for Knowledge Work

在大型企业中应用Anthropic原语:知识工作的 harness 范式

George Juraj Salapa

机构 * G.S. s.r.o(G.S.有限责任公司) PwC Austria(普华永道奥地利公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文针对大型企业知识工作的代码维护痛点,提出基于 harness 范式的架构,通过统一核心、优化机制缩小研究发现与企业采用的治理差距。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00663 2026-08-24 cs.AI cs.LG q-bio.BM 版本更新 62%

SEISMO: Explanation-Aware, Trajectory-Conditioned LLM Agents for Sample-Efficient Molecular Optimisation

SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率

Fabian P. Krüger, Andrea Hunklinger, Adrian Wolny, Tim J. Adler, Igor Tetko, Santiago David Villalba

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) TUM School of Computation, Information(TUM计算、信息学院) Technology, Department of Mathematics(技术学院,数学系) Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) Machine Learning Research(机器学习研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。

Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28200 2026-08-24 cs.RO cs.LG q-bio.PE 版本更新 61%

A Deep Reinforcement Learning Framework for Closed-loop Guidance of Fish Schools via Virtual Agents

通过虚拟代理实现鱼群闭环引导的深度强化学习框架

Takato Shibayama, Hiroaki Kawashima

专题命中 Agent评测 :agent(abstract,comments);分类 cs.LG

AI总结 本文提出基于深度强化学习的鱼群闭环引导框架,利用虚拟代理进行实时交互,通过复合奖励函数平衡方向引导与社会凝聚力,并发现物理实验中白底和较大刺激尺寸能提升引导效果,但群体规模增大时引导能力显著下降。

Comments 29 pages, 10 figures. Revised version with additional statistical and agent-behavior analyses. Corrections and improvements throughout

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06060 2026-08-24 cs.MA cs.AI cs.GT 版本更新 61%

AI-driven Prices for Externalities and Sustainability in Production Markets

生产市场中外部性与可持续性的AI驱动定价

Panayiotis Danassis, Aris Filos-Ratsikas, Haipeng Chen, Milind Tambe, Boi Faltings

专题命中 Agent评测 :agent(abstract);分类 cs.AI;autonomous agent(comments)

AI总结 该研究针对传统竞争市场未考虑负外部性的问题,提出深度强化学习策略智能体方法调整生产市场价格,在稀缺资源环境中维持资源可持续性的效果优于市场均衡结果。

Comments Accepted to the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21310 2026-08-24 cs.SE 新提交 57%

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis

超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究

Qisheng Lu, Aoyang Fang, Junjielong Xu, Jin'ao Shang, Songhan Zhang, Yifan Yang, Xiaochuan Yan, Pinjia He

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21075 2026-08-24 cs.SD cs.LG 新提交 57%

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

AudioWorldSim:用于世界模型的真实双耳音频数据集

Luis Vitor Zerkowski, Luiz Velho

机构 * VISGRAF IMPA(巴西纯数学与应用数学国家研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究提出开源平台AudioWorldSim,作为SoundSpaces 2.0的自定义扩展,用于生成真实双耳音频数据集,助力基于音频的机器学习尤其是世界模型研究,相关资源已公开以提升可重复性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20974 2026-08-24 cs.CV cs.AI 新提交 57%

WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

WA-JEPA:重新思考面向自动驾驶中世界-动作建模的视频JEPA范式

Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 该研究针对V-JEPA不适用于自动驾驶规划的问题,提出WA-JEPA模型,采用混合未来掩码预训练与条件流匹配,在NAVSIM和HUGSIM基准上取得优于基线的规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20797 2026-08-24 cs.AI 新提交 57%

Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

基于步骤级结果推理与聚合的移动智能体自动轨迹评估

Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng

机构 * Jiutian Research(九天研究院) China Mobile(中国移动)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18423 2026-08-24 cs.AI 版本更新 57%

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

FM-Bench:用于多智能体竞争的长周期管理基准

Tianyou Wang, Chongyang Gao, Kezhen Chen, Dong Chen, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li

机构 * AnalogyAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出FM-Bench基准,通过足球管理任务评估15个前沿LLM智能体的长周期决策能力,发现模型管理行为而非计算能力决定得分,排名与模型规模、价格或供应商无关。

详情

展开后加载摘要…

URL PDF HTML 收藏