arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2608.18085 2026-08-20 cs.CL 新提交 57%

Persona-Guided LLM Agents for Task-Oriented Dialogue

面向任务型对话的角色引导大语言模型智能体

Maryam Shoaeinaeini, Brent Harrison, A. B. Siddique

机构 * University of Kentucky(肯塔基大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究构建无需训练的框架,通过三种情境评估多模型在SGD数据集上的表现,发现适应用户人格存在权衡,Try情境的线索式适应可更可靠实现感知人格的任务型对话。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17800 2026-08-19 cs.AI 新提交 57%

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

StartupBench:基于市场验证的端到端工作流程的通用智能体基准测试

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang

机构 * ByteDance Seed(字节跳动 Seed) Nanjing University(南京大学) M-A-P

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出StartupBench基准测试,基于市场验证的AI初创产品工作流程评估通用智能体,发现当前最强模型仅完成约30%任务,该基准可衡量智能体完成现实用户任务的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17524 2026-08-19 cs.LG 新提交 57%

Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents

通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法

Ram Rachum, Yotam Amitai, Bálint Gyevnár, Reuth Mirsky, Cameron Allen

机构 * University of California, Berkeley(加州大学伯克利分校) Tufts University(塔夫茨大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。

Journal ref Proceedings of the Workshop on Explainable Artificial Intelligence (XAI) at IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17433 2026-08-19 cs.AI cs.MA 新提交 57%

Task-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure Operations

面向关键任务基础设施操作中LLM智能体的任务感知工具链配置

Liangtao Lin, Qingang Zhang, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的工具链配置问题,提出映射引导的升级算法,在液体冷却任务中提升了准确率并减少token使用,在电网任务中提供低成本替代方案,揭示工具链配置遵循领域依赖的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17271 2026-08-19 cs.AI 新提交 57%

ASI-Bench: At the Dawn of Artificial Superintelligence

ASI-Bench:人工智能超级智能的黎明

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie

机构 * Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Boston University(波士顿大学) University of Queensland(昆士兰大学) University of Science and Technology of China(中国科学技术大学) Flatiron Institute(弗拉蒂伦研究所) Microsoft Research(微软研究院) AG2 AI(AG2 AI公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究人员推出首个联合评估AI创新探索与自主科学执行能力的基准ASI-Bench,逐步减少人类方法指导测试AI自主科研能力,发现当前AI仍严重依赖人类指导,该基准面向全球开放邀请贡献。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17167 2026-08-19 cs.IT cs.AI cs.SY eess.SY math.IT stat.ML 新提交 57%

Expected free energy as an information constraint on the Bethe Lagrangian

期望自由能作为Bethe拉格朗日量的信息约束

Wouter M. Kouw

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出受信息约束的Bethe拉格朗日量,可恢复主动推理的期望自由能解,经实验验证其在三个任务上的性能可与EFE和Q-MDP相媲美。

Comments 17 pages, 4 figures, table 2. International Workshop on Active Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16349 2026-08-18 cs.AI 新提交 57%

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准

Yuchen Yuan, Zhenghuang Wu, Yuangan Li, Liang Ma, Ke Li

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。

Comments 38 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 57%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15090 2026-08-18 cs.CV cs.LG 新提交 57%

Distribution-free false-alarm calibration and chance-corrected spatial evaluation for industrial anomaly detection

面向工业异常检测的无分布虚警校准与经机会校正的空间评估

Jie Deng

机构 * Tongji University(同济大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 该研究针对工业异常检测现有指标的缺陷,提出结合无分布上限容差阈值与配对减交叉空间检验的方法,在多数据集上验证了其有效性,支持同时报告工作点性能与经机会校正的空间证据。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15008 2026-08-18 cs.CL 新提交 57%

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents

利用记忆:记忆智能体中记忆载体的整体评估

Wei-Chieh Huang, Weizhi Zhang, Yuchen Wu, Yankai Chen, Eric Hanchen Jiang, Wooseong Yang, Yiwei Yang, Henry Peng Zou, Hanrong Zhang, Ying Nian Wu, Haolun Wu, Kai-Wei Chang, Philip S. Yu, Xue Liu, Aylin Caliskan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Washington(华盛顿大学) McGill University(麦吉尔大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究评估了记忆智能体的多种记忆载体,发现无通用最优载体,不同载体适配不同场景,为自适应智能体记忆系统设计提供了实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14956 2026-08-18 cs.LG cs.LO 新提交 57%

LLM-based Framework for Generating and Verifying Parallel DEVS Statecharts

基于大语言模型的并行DEVS状态图生成与验证框架

Vamsi Krishna Vasa, Hessam S. Sarjoughian, Edward J. Yellig

机构 * Arizona State University(亚利桑那州立大学) Intel Corporation(英特尔公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本研究提出智能体式PDEVS-LLM框架,辅助建模人员生成验证PDEVS状态图,经评估该框架可显著提升生成状态图的逻辑一致性。

Comments 22 pages, 5 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14903 2026-08-18 cs.AI 新提交 57%

Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence

前沿AI预测存在测量问题:对进展证据的审计

Fabricio F Costa

机构 * AIx4All, LLC(AIx4All有限责任公司) HCLTech(HCLTech公司) Stanley Manne Children’s Research Institute(斯坦利·曼恩儿童研究所) Ann & Robert H. Lurie Children’s Hospital of Chicago(安与罗伯特·H·卢里芝加哥儿童医院) Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文审计前沿AI预测的测量问题,构建含多类元素的冻结记录,发现训练计算量、METR horizon等关键数据缺失,基准更迭存在断点,来源高度集中,提出需明确版本化测量系统的预测主张。

Comments 16 pages, 6 figures, 1 table. Evidence cutoff: 12 August 2026. Ancillary code and data included. Preprint; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14642 2026-08-18 cs.LG 新提交 57%

Training and Evaluating Ethical Reinforcement Learning Agents on Per-Episode Distributions

基于每回合分布的伦理强化学习智能体训练与评估

Prabhjyot Singh, Majid Ghasemi, Mark Crowley

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对强化学习智能体的伦理训练与评估问题,在Craftax基准上对比四种方法,发现ESR准则下的智能体可在每回合维持违规预算,且训练评估需关注每回合分布而非均值。

Comments 11 Pages, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14641 2026-08-18 cs.AI 新提交 57%

Task- and Session-Level Model Routing: A Common-Interface Hybrid Evaluation of Four Open-Source Routers Across Four Benchmarks

任务与会话级模型路由:四个基准测试中四种开源路由的通用接口混合评估

Kiran N. Kumar, Santhosh K. Saminathan

机构 * Indiana University(印第安纳大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 该研究提出通用测量协议,在四个基准上混合评估四种开源路由,发现多数路由层级分配恒定,vLLM语义路由随提示变化但无最高成功率,需控制固定层级基线以评估路由。

Comments 34 pages, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13684 2026-08-17 cs.AI 新提交 57%

Learning to Assemble Novel Structures with Unfamiliar Parts under Semantic Constraints

在语义约束下学习使用不熟悉部件组装新型结构

Jonghyuk Park, Alex Lascarides, Subramanian Ramamoorthy

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出神经符号架构,在模拟玩具卡车组装领域,借助具身对话与任务演示,通过自然语言传递语义约束提升智能体在线适应的数据效率,解决部署后遇未知语义约束的组装问题。

Comments Accepted to, and to appear in the 20th Conference on Neurosymbolic Learning and Reasoning (NeSy 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13598 2026-08-17 cs.AI 新提交 57%

Measuring Cross-Task Behavioral Consistency in Language Model Agents

测量语言模型智能体的跨任务行为一致性

Amritesh Banerjee, Pranil Raichura

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mantis AI Research(螳螂人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出行为一致性指标(BCM),通过约9000条软件工程任务轨迹发现语言模型智能体的跨任务与任务内一致性是可分化的不同维度,且一致性与成功率无关,BCM可补充结果指标评估智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13173 2026-08-14 cs.AI 新提交 57%

SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents

SkillShapley:面向大语言模型智能体技能步骤归因的边界自适应夏普利值评估方法

Chang Liu, Yuqi Zhang, Yiman Zhong, Boyi Liu, Hengjun Wang, Shuyue Wei

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SkillShapley是面向大语言模型智能体技能步骤归因的框架,将技能步骤归因建模为夏普利值估计问题,经SkillsBench实验可高效识别技能步骤价值,为智能体技能构建提供启示。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交 57%

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13096 2026-08-14 cs.LG cs.CE q-fin.CP q-fin.TR 新提交 57%

FlowLOB: Efficient and Controllable Limit Order Book Generation with Flow Matching

FlowLOB:基于流匹配的高效可控限价订单簿生成模型

Zhuohan Wang, Andreea Bacalum, Ollie Olby, Carmine Ventre, Namid Stillman

机构 * Simudyne(思慕迪恩) King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出FlowLOB,一种基于流匹配的LOB轨迹生成模型,经HKEX数据训练可泛化至未见过的交易品种,采样效率与可控性优于基准模型,且能零样本泛化。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-08-14 cs.LG 新提交 57%

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11878 2026-08-13 cs.CR cs.CL 新提交 57%

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境

Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11873 2026-08-13 cs.LG 新提交 57%

DCM Bandits: Multiplayer Information Asymmetric Cascading Bandits for Multiple Clicks

DCM 老虎机:面向多点击的多人信息非对称级联老虎机

Andy Wang, Charlton Shih, William Chang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究将DCM老虎机扩展至多人信息非对称多点击场景,针对含非对称性的三种场景提供次线性悔恨保证,改进了单智能体结果,算法在非对称环境中表现良好,凸显反馈结构的关键作用。

Comments Accepted to the Asia Conference on Machine Learning and Computing (ACMLC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11211 2026-08-13 cs.AI cs.SC math.CO 新提交 57%

A Forced-Structure Reduction and Verifiable Bounds for Conway's 99-Graph

康威99-图的强制结构约简与可验证边界

Aalok Thakkar

机构 * Ashoka University(阿育王大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究通过自主AI智能体对康威99-图问题展开系统性可复现研究,完成强制结构约简、可验证边界等贡献,获最佳验证成果69.43%。

Comments This paper is accepted to the first Conference For AI Scientists (CAISc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10567 2026-08-12 cs.AI 新提交 57%

DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation

DashArena:面向交互式分析仪表板生成的大语言模型基准测试

Xiaotong Wang, Dazhen Deng

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 研究人员推出首个交互式分析仪表板生成基准DashArena,含轨迹回放与VLM评判,提炼出DashJudge-8B,发现前沿模型仍存多类缺陷,交互评估可捕捉遗漏问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10471 2026-08-12 cs.AI 新提交 57%

RLMOpt: Adaptive Prompt Optimization via Recursive Language Models

RLMOpt:基于递归语言模型的自适应提示优化器

Subhash Bangalore Satheesha, Nirvik Pande, Deepthi Duddempudi, Bharath Dandala

机构 * Autonomize AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出基于递归语言模型(RLM)的自适应提示优化器RLMOpt,在四个基准上相比GEPA表现更优,效率更高且提示更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10327 2026-08-12 cs.AI 新提交 57%

Toward a Theory of Value in AI Alignment

迈向AI对齐中的价值理论

Andrew Smart, Shazeda Ahmed, Jackie Kay, Jimmy Tobin, Kris Shrishak, Abeba Birhane

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本研究通过标注94篇AI价值对齐论文,发现多数未明确定义人类价值,转而依赖偏好,且采用合成数据等自动方法可能关闭价值践行路径,旨在明确该领域哲学承诺以丰富相关辩论。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 57%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09988 2026-08-12 cs.CE cs.CL 新提交 57%

OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

OpenPM:面向LLM投资组合管理智能体的可审计时点评估框架

Xinying Cai, Minghao Guo, Jiahe Liu, Jiaojiao Han, Bangwei Guo, Yitao Long, Yuxuan Chen, Bohan Wu, Dimitris N. Metaxas, Raymond Li

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 OpenPM是面向LLM投资组合管理智能体的可审计时点评估框架,构建了分层分配器参考智能体,发现分析师质量比构造器选择更重要,换手率是主要成本驱动因素。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09902 2026-08-11 cs.AI cs.NE 新提交 57%

DSLE: A Learning Environment for Dark Souls Boss Encounters

DSLE:《黑暗之魂》Boss 遭遇战的学习环境

Derin Gezgin, Jim O'Connor, Tanner Goodwin, Gary B. Parker

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究推出 DSLE 平台,将《黑暗之魂》22 场 Boss 战作为智能体基准,定义 DSLE-5 子集并评估多种智能体,发现多数方法难以击败多数 Boss,仅少数早期 Boss 可被击败。

Comments AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09476 2026-08-11 cs.CR cs.AI 新提交 57%

ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

ActBench:协作智能体行为安全的自演进基准

Hongwei Yao, Yiming Liu, Meihui Chen, Jieling Chen, Zikun Chen, Yiling He, Wangze Ni, Cong Wang, Kui Ren

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。

Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench

详情

展开后加载摘要…

URL PDF HTML 收藏