arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2502.08514 2025-02-14 cs.CL 84%

Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation

Mahnaz Koupaee, Jake W. Vincent, Saab Mansour, Igor Shalyminov, Han He, Hwanjun Song, Raphael Shu, Jianfeng He, Yi Nian, Amy Wing-mei Wong, Kyu J. Han, Hang Su

专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15579 2026-08-18 cs.SE cs.AI cs.ET cs.PL 新提交 84%

Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair

Kozuchi智能体:一款与语言无关的开源权重软件修复智能体

Mehdi Bahrami, Kosaku Kimura, Satoshi Munakata, Satoshi Nakashima, Yu Ishikawa, Kosuke Maeda, Nao Soma, Kenichi Kobayashi, Keisuke Miyazaki, Keizo Kato, Shigeki Fukuta, Tatsuo Kumano, Nobutaka Imamura, Kevin Musgrave, Shahbaz Abdul Khader, Kwun Ho Ngan, Joe Townsend, Fayas Asharindavida, Matthieu Parizy, Akira Sakai, Yuma Ichikawa, Yang Zhao, Michiaki Takizawa, Taku Fukui, Hiroki Ohtsuji, Wei-Peng Chen, Hiromichi Kobashi

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Kozuchi智能体,一款与语言无关的开源权重软件修复智能体,结合CI评估流水线,在SWE-bench等基准上取得优异性能,降低操作接触点,为软件修复提供新方案。

Comments 13 pages, 4 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), Industry Showcase track, Munich, Germany, October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13608 2026-08-17 cs.AI cs.CR cs.LG 新提交 84%

Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis

基于缩放假设的无标签智能体学习控制器能力评估

Aryan Luthra, Kshitij Jain, Siddharth Arya, Bobby Filar, Anna Bertiger

机构 * Georgian

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于缩放假设的无标签智能体学习控制器评估框架,以教师模型与学生模型的收敛度为评分指标,验证其可作为标签缺失时控制器真实增益的有效代理。

Comments 18 pages, 6 figures. Accepted at CAMLIS 2025 (Conference on Applied Machine Learning for Information Security)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11469 2026-08-13 cs.CR cs.AI cs.SE 新提交 84%

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

智能体网络安全的下一个挑战:一个现实、无污染的逆向工程基准

Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对智能体逆向工程基准的缺陷,构建SRE-Bench基准,评估五款前沿LLMs的逆向工程能力,发现RE仍未解决,强调其为智能体网络安全重要前沿及SRE-Bench的测试价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11236 2026-08-13 cs.CL cs.AI 新提交 84%

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

TRACE Bench:任务驱动的角色扮演智能体清单评估基准

Jiahui Zhang, Ziwei Zhang, Yipeng Wang, Yibo Liu, Haozhou Pang, Yikai Hu, Hongyan Ren, Lan Zhou, Qi Gan, Kai Sheng

机构 * Kuaishou GameMind Lab(快手GameMind实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对角色扮演评估的黑箱问题,提出TRACE Bench框架,通过清单分解与对话跟踪实现更透明的评估,在覆盖度、鲁棒性等方面优于现有基准,支持闭环演化。

Comments Project page: https://kuaishou-gamemind.github.io/projects/trace_bench/. Code: https://github.com/KuaishouGameMind/TRACE-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02687 2026-08-11 cs.AI cs.CL 版本更新 84%

The Collaboration Gap: Exploration and Benchmarking of Open-World Agentic Cooperation

协作差距:开放世界智能体协作的探索与基准测试

Tim R. Davidson, Adam Fourney, Saleema Amershi, Robert West, Eric Horvitz, Ece Kamar

机构 * EPFL(瑞士联邦理工学院) Microsoft Research(微软研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出协作迷宫求解基准,评估32个模型的协作能力,发现模型存在协作差距,提出中继推理等缓解措施,强调协作相关评估、训练与交互设计的重要性。

Comments Accepted to COLM 2026, code available at https://github.com/trdavidson/collaboration_gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05266 2026-08-07 cs.AI cond-mat.mtrl-sci cs.LG 新提交 84%

Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

智能体自动驾驶显微镜基准测试支持性能验证,但不一定能泛化到未见任务

Nathan S Johnson, Ian Abshire

机构 * Carl Zeiss Research Microscopy Solutions(卡尔蔡司研究显微镜解决方案)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发基准框架评估显微镜智能体架构等因素的性能,发现其虽可用于验证比较,但现有基准无法预测智能体在未见显微镜任务上的表现。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04761 2026-08-07 cs.CL cs.AI 版本更新 84%

InsightEmb: Learning Action-Intent Embeddings for Agentic Insight Retrieval

InsightEmb:面向智能体洞察检索的动作-意图嵌入学习

Tsz Ting Chung, Jiangnan Li, Jie Zhou, Mo Yu

机构 * The Hong Kong University of Science and Technology(香港科技大学) WeChat AI, Tencent(腾讯微信人工智能)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对智能体洞察检索任务,提出对比嵌入框架InsightEmb,利用数学推理数据学习可迁移的检索几何结构,在无特定环境训练时优于现有模型,验证了匹配几何结构的跨域迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 84%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26791 2026-07-30 cs.CR cs.AI cs.CL 新提交 84%

SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

SecRespond:面向真实入侵后事件响应的AI智能体基准测试集

Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu, Shuo Wang, Tao Lei, Xin Ouyang, Xiaomeng Li

专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26490 2026-07-30 cs.AI cs.LG cs.NE 新提交 84%

EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks

EvoPINN:面向物理信息神经网络可执行算法的智能体式发现框架

Peng Yin, Kai Li, Yifan Zhang, Jian Cheng

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 EvoPINN是智能体式框架,将PINN开发转化为基于执行的算法发现,通过LLM智能体迭代优化,自主发明SLRC-PINN,可显著降低PDE求解的相对L₂误差,为科学计算提供新机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26313 2026-07-30 cs.SE cs.AI cs.CY 新提交 84%

SARC-DQ: Runtime Data-Quality Gating for Agentic AI: Silent Evidence Defects, the Incompetence Shield, and Downstream-Only Remediation

SARC-DQ:智能体AI的运行时数据质量门控:隐性证据缺陷、无能防护机制与仅下游修复

Gaston Besanson

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对智能体AI的元数据缺陷问题,提出SARC-DQ运行时数据质量门控机制,实验显示模型能力未提升怀疑能力,所提门控结合下游修复可恢复部分损失,无模型预言机能精准跟踪缺陷率。

Comments https://github.com/besanson/dqSarc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10156 2026-07-28 cs.IR cs.AI cs.CL 版本更新 84%

$τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems

$τ$-Rec:面向智能推荐系统的可验证基准

Bharath Sivaram Narasimhan, Karthik R Narasimhan

机构 * Independent Researcher(独立研究员) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。

Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22321 2026-07-27 cs.CR cs.AI cs.SE 版本更新 84%

ASEval: Automated Trajectory-Level Security Testing for Autonomous Agents

对时间、空间和语义规避的自主代理进行基准测试

Jianan Ma, Xiaohu Du, Ruixiao Lin, Yaoxiang Bian, Jialuo Chen, Yunhao Feng, Xiaofang Yang, Shiwen Cui, Changhua Meng, Xinhao Deng, Jingyi Wang, Zhen Wang

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种针对基于大语言模型(LLM)的代理系统的多维规避框架,通过引入时间、空间和语义三种隐蔽攻击向量,系统地量化了这些威胁,并展示了其在实际威胁场景中的效果,揭示了现有自主代理系统在架构层面的系统性漏洞。

Comments 18 pages, 12 figures, 8 tables. Code and data available at https://github.com/antgroup/Agent3Sigma-Stage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20478 2026-07-24 cs.SE cs.AI 新提交 84%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13705 2026-07-21 cs.AI cs.SE 版本更新 84%

AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

AgentCompass:用于智能体能力的统一评估基础设施

Kai Chen, Zichen Ding, Jiaye Ge, Shufan Jiang, Mo Li, Qingqiu Li, Zehao Li, Zonglin Li, Tianhao Liang, Shudong Liu, Zerun Ma, Zixin Shang, Wenhui Tian, Zun Wang, Liwei Wu, Zhenyu Wu, Jun Xu, Bowen Yang, Dingbo Yuan, Qi Zhang, Songyang Zhang, Peiheng Zhou, Dongsheng Zhu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型演变成自主智能体后评估基础设施分散的问题,提出AgentCompass,通过围绕三个独立组件组织评估过程,具备容错异步运行时和轨迹分析工具,支持多基准测试,为智能体研究提供可扩展、可重复的基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04460 2026-07-21 cs.CR cs.AI cs.LG 版本更新 84%

CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capabilities

CyberGym-E2E:面向AI代理端到端网络安全能力的可扩展真实世界基准

Tianneng Shi, Robin Rheem, Dongwei Jiang, Mona Wang, Francisco De La Riega, Zhun Wang, Jingzhi Jiang, Alexander Cheung, Sean Tai, Jonah Cha, Jianhong Tu, Gabriel Han, Chenguang Wang, Jingxuan He, Wenbo Guo, Dawn Song

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出CyberGym-E2E,一个大规模、真实的端到端网络安全基准,通过自动化流水线将开源漏洞数据转化为评估环境,全面评估AI代理在漏洞发现、PoC生成和补丁生成全生命周期中的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14989 2026-07-17 cs.CL cs.AI 新提交 84%

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench:跨多样场景对通用人工智能智能体进行基准测试

Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

专题命中 Agent评测 :AI agent(title);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09065 2026-07-13 cs.SE cs.AI 新提交 84%

Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills

深入技能市场:从软件工程活动到可复用的智能体技能

Jialun Cao, Xinru Yan, Songqiang Chen, Yaojie Lu, Zhongxin Liu, Shing-Chi Cheung

机构 * The Hong Kong University of Science(香港科技大学) University of Chinese Academy of Sciences Beijing, China(中国科学院大学) Institute of Software, Chinese Academy of Sciences Beijing, China(中国科学院软件研究所) Zhejiang University Hangzhou, China(浙江大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨软件工程活动如何转化为可复用智能体技能。通过对公共库和市场中SE技能大规模实证研究,分析其封装活动、生命周期覆盖等,发现SE活动正通过技能成为可复用工件,为技能推荐等提供研究机会及相关机制需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03195 2026-07-09 cs.AI cs.SE 版本更新 84%

Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

Terminus-4B:一个较小的模型能否在智能体执行任务中取代前沿大语言模型?

Spandan Garg, Vikram Nitin, Yufan Huang

机构 * Microsoft USA(微软公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究智能体终端执行任务中较小模型能否取代前沿大语言模型。提出经监督微调及强化学习训练的Terminus-4B模型,评估发现其能减少主智能体令牌使用量约30%,不影响性能,还缩小与前沿模型差距甚至超越其性能。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03510 2026-07-07 cs.SE cs.AI cs.CY 新提交 84%

CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI

CAGE-1:企业智能代理人工智能的控制、保证和治理评估

Roopam W. Sure

机构 * Independent technical report(独立技术报告)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究企业人工智能从实验转向运营工作流带来的评估问题,介绍CAGE-1评估框架,评估多方面内容,引入预绑定保证,用于判断企业代理是否可部署。

Comments 17 pages, 3 figures; independent technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交 84%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01874 2026-07-03 cs.AI cs.CL 新提交 84%

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach: 用于评估和增强智能体技能使用的自演化评分准则

Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SkillCoach框架,通过自演化过程评分准则从技能选择、遵循、组合和反思四维度评估智能体轨迹,并利用演化准则筛选高质量训练数据,提升技能使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04390 2026-07-03 cs.AI cs.SE 版本更新 84%

A Dual-Helix Governance Approach Towards Reliable Agentic Artificial Intelligence for WebGIS Development

面向可靠WebGIS开发的代理人工智能双螺旋治理方法

Boyuan Guan, Wencong Cui, Levente Juhasz

机构 * Geographic Information Systems Center, Florida International University(佛罗里达国际大学地理信息系统中心) Geospatial Analytics, Technology and Open Research Lab, University of Florida(佛罗里达大学地理空间分析、技术与开放研究实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 针对代理AI在WebGIS开发中的不可靠问题,提出双螺旋治理框架,通过知识-行为-技能三轨架构和持久知识图谱外化事实与协议,实验证明能降低代码复杂度、减少输出方差并防止制图错误。

Comments Paper submitted to and under review in Transactions in GIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26327 2026-06-26 cs.LG cs.AI 新提交 84%

EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning

EVOM:用于强化学习的演员-评论家架构的智能体元进化

Boyun Zhang, Chao Wang, Kai Wu

机构 * Xidian University(西安电子科技大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出EVOM框架,通过双层优化(内环低保真PPO训练权重,外环LLM设计智能体驱动元进化)自动搜索高性能演员-评论家架构,在Ant-v4和HalfCheetah-v4上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 84%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20629 2026-06-23 cs.MA cs.AI cs.LG 新提交 84%

Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams

专业化角色,混合部署:推动LLM代理团队的成本-精度前沿

Yinsicheng Jiang, Liang Cheng, Yeqi Huang, Yufan Zhao, Zhan Lu, Li Dong, Wenda Li, Edoardo Ponti, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20585 2026-06-23 cs.HC cs.AI cs.CL 新提交 84%

Turning Intent into Specifications: A Benchmark and an Interactive User-Assistant Agent

将意图转化为规范:一个基准测试和一个交互式用户助手代理

Hao Wang, Ligong Han, Kai Xu, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) IBM Core AI(IBM核心AI)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出SpecBench基准和Buddy代理,通过形态分析分解用户意图、模拟用户评估设计选择,将焦点从代码生成转向人机协作规范制定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06445 2026-06-16 cs.CL cs.AI cs.CR 版本更新 84%

A Survey on Agentic Security: Applications, Threats and Defenses

关于智能体安全的综述:应用、威胁与防御

Asif Shahriar, Md Nafiu Rahman, Sadif Ahmed, Farig Sadeque, Md Rizwan Parvez

机构 * BRAC University(布拉克大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文首次全面综述智能体安全领域,围绕应用、威胁与防御三大支柱,分类260余篇论文,分析攻击入口、防御策略及生命周期覆盖,指出智能体系统默认结构脆弱,需全生命周期防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12774 2026-06-12 eess.SY cs.AI cs.CL cs.SY 新提交 84%

Agentic MPC for Semantic Control System Resynthesis

用于语义控制系统再综合的智能体MPC

Yuya Miyaoka, Masaki Inoue

机构 * University of Tokyo(东京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出智能体MPC框架,通过集成大语言模型智能体实现上下文感知的语义自适应控制综合,在自动驾驶场景中验证其根据个人偏好或社交情境(如避让应急车辆)调整控制的能力。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏