arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2601.05899 2026-05-27 cs.AI 77%

TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents

TowerMind: 一个用于LLM作为智能体的塔防游戏学习环境与基准

Dawei Wang, Chengming Zhou, Di Zhao, Xinyuan Liu, Marci Chi Ma, Gary Ushaw, Richard Davison

机构 * Newcastle University(新castle大学) University of Auckland(奥克兰大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出TowerMind,一个基于塔防子类型的轻量级、多模态游戏环境,用于评估大语言模型在长期规划和决策中的能力,并揭示其与人类专家的性能差距及关键局限性。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24069 2026-05-26 cs.CR cs.AI 77%

When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents

当手册撒谎:评估LLM智能体MCP投毒攻击的现实基准

Shi Liu, Xuehai Tang, Xikang Yang, Liang Lin, Biyu Zhou, Wenjie Xiao, Wantao Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 针对LLM智能体通过模型上下文协议(MCP)集成外部工具时面临的工具描述投毒(TDP)攻击,提出MCP-TDP安全基准,包含32个真实测试用例,评估8种主流LLM发现严重漏洞,并提出反应性自我纠正防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00851 2026-05-22 cs.AI cs.MA 77%

Understanding Persuasion in Long-Running Agents

理解长期运行代理中的说服

Hyejun Jeong, Amir Houmansadr, Shlomo Zilberstein, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文研究了长期任务中代理受到用户说服影响的行为变化,提出了一种基于行为的评估框架,发现提前指定信念状态的代理在搜索和源访问上表现更高效,表明说服影响代理行为。

Comments Code available at https://github.com/HyejunJeong/persuasion-propagation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15377 2026-05-19 cs.AI 77%

Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute

为AI控制的集束监控:多样信号胜过更多计算

Eugene Koran, Yejun Yun, Samantha Tetef, Benjamin Arnav, Pablo Bernabeu-Pérez

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文研究了通过结合多种监控信号来提高AI行为检测的性能,发现多样性的监控集合比单一或同质的监控集合更有效,且细调的监控方法在检测能力上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17044 2026-05-19 cs.AI 77%

PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models

PersonaArena: 用于评估和提升大语言模型层面角色扮演的动态模拟

Wenlong Shi, Jianxun Lian, Mingqi Wu, Haiming Qin, Mingyang Zhou, Xing Xie, Naipeng Chao, Hao Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Microsoft Research Asia(微软亚洲研究院) Microsoft Gaming(微软游戏) Provincial Key Laboratory of Intelligent Communication and Digital Society Governance, Shenzhen University(深圳大学省级智能通信与数字社会治理重点实验室)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出PersonaArena框架,通过动态模拟评估和提升大语言模型在角色扮演层面的能力,利用用户生成的社会内容构建细致的个性库,并在模拟社交环境中进行多轮上下文丰富的交互,通过多代理辩论裁判实现全面公正的评估。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16909 2026-05-19 cs.AI 77%

TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

TOBench:面向真实世界工具使用代理的任务导向多模态基准

Zhiqiang Liu, Wenhui Dong, Yilang Tan, Yuwen Qu, Haochen Yin, Chenyang Si

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) Southwest Jiaotong University(西南交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出TOBench,一个面向真实世界工具使用代理的多模态基准,通过闭环多模态验证设计,评估和推动下一代多模态工具使用代理的发展。

Comments Github: https://github.com/Pi3AI/TOBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07191 2026-05-19 cs.RO cs.LG stat.ME 77%

Curb Your Attention: Causal Attention Gating for Robust Trajectory Prediction in Autonomous Driving

抑制注意力:因果注意力门控用于自动驾驶中的鲁棒轨迹预测

Ehsan Ahmadi, Ray Mercurius, Soheil Alizadeh, Kasra Rezaee, Amir Rasouli

机构 * University of Alberta(阿尔伯塔大学) Noah’s Ark Laboratory, Huawei Technologies Canada(华为加拿大诺亚实验室) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.LG

AI总结 本文提出CRiTIC模型,通过因果发现网络识别agent间因果关系,并引入因果注意力门控机制提升轨迹预测的鲁棒性和泛化能力,实验表明模型在对抗非因果扰动时鲁棒性提升54%。

Comments Accepted ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16616 2026-05-19 cs.LG 77%

MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility

MLReplicate:用于机器学习可重复性自主研究系统的基准测试

Sasi Kiran Gaddipati, Diyana Muhammed, Farhana Keya, Gollam Rabby, Sören Auer

机构 * TIB—Leibniz Information Centre for Science and Technology(蒂宾根-莱比锡信息科学与技术研究中心) L3S Research Center, Leibniz University Hannover(莱比锡大学汉诺威分校L3S研究中心)

专题命中 Agent评测 :agent(abstract,abstract_cn);workflow(abstract);分类 cs.LG

AI总结 本文提出MLReplicate基准测试,评估自主研究系统在机器学习可重复性方面的性能,发现计算规模并非决定性因素,且系统间存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15581 2026-05-18 cs.AI 77%

STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices

STAR: 一种针对微服务中RCA代理的阶段属性分诊与修复框架

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出STAR框架,通过将RCA流程分解为四个阶段,提升微服务中RCA代理的可靠性与自修复能力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 77%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI 77%

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 77%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 77%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01338 2026-05-05 cs.AI 77%

DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

DiagramNet: 一种面向非标准系统级图表的端到端识别框架和数据集

Jincheng Lou, Ruohan Xu, Jiapeng Li, Junyin Pi, Runzhe Tao, Weijian Fan, Xiao Tan, Guojie Luo, Yibo Lin

机构 * School of IC, Peking University, Beijing, China(北京大学信息科学技术学院) College of Artificial Intelligence, Xi'an Jiaotong University, Xi'an, China(西安交通大学人工智能学院) Department of Precision Instruments, Tsinghua University, Beijing, China(清华大学精密仪器系) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Institute of EDA, Peking University, Beijing, China(北京大学EDA研究院) Beijing Advanced Innovation Center for IC, Beijing, China(北京集成电路先进创新中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DiagramNet数据集和训练框架,通过端到端方法在系统级图表识别中超越现有模型,提升多模态大语言模型的图表理解能力。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14240 2026-04-21 cs.AI 77%

LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild

LiveResearchBench: 一个用于真实世界中以用户为中心的深度研究的实时基准

Jiayu Wang, Yifei Ming, Riya Dulepet, Qinglin Chen, Austin Xu, Zixuan Ke, Frederic Sala, Aws Albarghouthi, Caiming Xiong, Shafiq Joty

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学) Salesforce AI Research(Salesforce AI研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出LiveResearchBench,一个包含100个专家精选任务的实时基准,涵盖日常生活、企业与学术领域,要求进行广泛、动态的实时网络搜索与综合。通过DeepEval评估17个前沿深度研究系统,揭示其优势、失败模式及关键组件。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14683 2026-04-17 cs.AI 77%

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

DR$^{3}$-Eval: 向真实和可重复的深度研究评估迈进

Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu

机构 * Nanjing University(南京大学) M-A-P Jiutian Research(九天研究) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DR$^{3}$-Eval基准,用于评估多模态多文件报告生成的深度研究代理,通过真实用户材料和静态研究沙盒语料结合,引入多维评估框架,验证其与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07733 2026-04-10 cs.AI 77%

CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V

CivBench:基于进展的评估用于LLM在文明V中的战略决策

John Chen, Sihan Cheng, Can Gurkan, Mingyi Lin

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 CivBench通过训练模型在回合级游戏状态上估计胜利概率,评估LLM在文明V多玩家中的战略决策能力,揭示代理设置对模型的影响及不同战略特征。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01221 2026-04-02 cs.AI cs.CV 77%

HippoCamp: Benchmarking Contextual Agents on Personal Computers

HippoCamp:在个人电脑上对上下文代理进行基准测试

Zhe Yang, Shulin Tian, Kairui Hu, Shuai Liu, Hoang-Nhat Nguyen, Yichi Zhang, Zujin Guo, Mengying Yu, Zinan Zhang, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(新加坡南洋理工大学S-Lab)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 HippoCamp是一个新的基准,用于评估代理在多模态文件管理中的能力,通过用户为中心的环境建模个体用户档案并搜索大规模个人文件进行上下文感知推理,揭示了当前代理在真实环境中的局限性。

Comments Project Page: https://hippocamp-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28063 2026-03-31 cs.AI cs.GT 77%

Reward Hacking as Equilibrium under Finite Evaluation

奖励黑客行为作为有限评估下的均衡

Jiacheng Wang, Jinbin Huang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23660 2026-03-26 cs.AI 77%

GTO Wizard Benchmark

GTO Wizard 评估基准

Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02960 2026-03-24 cs.AI 77%

Architecting Trust in Artificial Epistemic Agents

在人工智能认知代理中构建信任

Nahema Marchal, Stephanie Chan, Matija Franklin, Manon Revel, Geoff Keeling, Roberta Fischli, Bilva Chandra, Iason Gabriel

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文探讨了大规模语言模型作为认知代理的影响,提出通过构建信任、对齐人类认知目标和加强社会认知基础设施,确保AI系统的可靠性与包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10971 2026-03-20 cs.CR cs.CL 77%

AJAR: Adaptive Jailbreak Architecture for Red-teaming

AJAR:适应性突破架构用于红队测试

Yipu Dou, Wang Yang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 AJAR框架通过可调用MCP服务实现多轮突破算法,提升X-Teaming攻击成功率至76.0%,并在工具访问下优化攻击面。

Comments 7 pages, 3 figures. Code and data available at https://github.com/douyipu/ajar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17170 2026-03-19 cs.CR cs.AI cs.PL 77%

PAuth - Precise Task-Scoped Authorization For Agents

PAuth - 精确任务范围授权 for 代理

Reshabh K Sharma, Linxi Jiang, Zhiqiang Lin, Shuo Chen

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 PAuth通过隐式授权模型精确控制代理执行任务所需的操作权限,通过NL切片和信封结构确保操作合法性,实验表明其在安全和性能上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22680 2026-03-17 cs.AI 77%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15112 2026-03-13 cs.AI 77%

ResearchGym: Evaluating Language Model Agents on Real-World AI Research

ResearchGym: 在真实世界人工智能研究中评估语言模型代理

Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。

Comments ICLR 2026 Agents in the Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09827 2026-03-12 cs.CV cs.AI 77%

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

MA-EgoQA:多智能体视角下的眼动视频问答

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Samsung Electronics(三星电子) ETRI(电子技术研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MA-EgoQA旨在解决多智能体视角下的眼动视频问答问题,通过引入多代理眼动问答基准和EgoMAS模型,评估现有方法在处理多眼动流中的不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 77%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07391 2026-03-10 cs.AI cs.MA 77%

NAAMSE: Framework for Evolutionary Security Evaluation of Agents

NAAMSE:用于智能体进化安全评估的框架

Kunal Pai, Parth Shah, Harshil Patel

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 NAAMSE通过进化框架提升智能体的安全评估,利用遗传突变和探索发现隐藏漏洞,提供更真实鲁棒性评估。

Comments Published at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06541 2026-03-09 cs.DB cs.AI cs.MA 77%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 77%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏