Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation
专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.CL
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(title);multi-agent(title);分类 cs.CL
Kozuchi智能体:一款与语言无关的开源权重软件修复智能体
专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 本文提出Kozuchi智能体,一款与语言无关的开源权重软件修复智能体,结合CI评估流水线,在SWE-bench等基准上取得优异性能,降低操作接触点,为软件修复提供新方案。
Comments 13 pages, 4 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), Industry Showcase track, Munich, Germany, October 12-16, 2026
基于缩放假设的无标签智能体学习控制器能力评估
机构 * Georgian
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出基于缩放假设的无标签智能体学习控制器评估框架,以教师模型与学生模型的收敛度为评分指标,验证其可作为标签缺失时控制器真实增益的有效代理。
Comments 18 pages, 6 figures. Accepted at CAMLIS 2025 (Conference on Applied Machine Learning for Information Security)
智能体网络安全的下一个挑战:一个现实、无污染的逆向工程基准
专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对智能体逆向工程基准的缺陷,构建SRE-Bench基准,评估五款前沿LLMs的逆向工程能力,发现RE仍未解决,强调其为智能体网络安全重要前沿及SRE-Bench的测试价值。
TRACE Bench:任务驱动的角色扮演智能体清单评估基准
机构 * Kuaishou GameMind Lab(快手GameMind实验室)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 研究针对角色扮演评估的黑箱问题,提出TRACE Bench框架,通过清单分解与对话跟踪实现更透明的评估,在覆盖度、鲁棒性等方面优于现有基准,支持闭环演化。
Comments Project page: https://kuaishou-gamemind.github.io/projects/trace_bench/. Code: https://github.com/KuaishouGameMind/TRACE-Bench
协作差距:开放世界智能体协作的探索与基准测试
机构 * EPFL(瑞士联邦理工学院) ; Microsoft Research(微软研究院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出协作迷宫求解基准,评估32个模型的协作能力,发现模型存在协作差距,提出中继推理等缓解措施,强调协作相关评估、训练与交互设计的重要性。
Comments Accepted to COLM 2026, code available at https://github.com/trdavidson/collaboration_gap
智能体自动驾驶显微镜基准测试支持性能验证,但不一定能泛化到未见任务
机构 * Carl Zeiss Research Microscopy Solutions(卡尔蔡司研究显微镜解决方案)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究开发基准框架评估显微镜智能体架构等因素的性能,发现其虽可用于验证比较,但现有基准无法预测智能体在未见显微镜任务上的表现。
Comments 20 pages, 8 figures
InsightEmb:面向智能体洞察检索的动作-意图嵌入学习
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; WeChat AI, Tencent(腾讯微信人工智能)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究针对智能体洞察检索任务,提出对比嵌入框架InsightEmb,利用数学推理数据学习可迁移的检索几何结构,在无特定环境训练时优于现有模型,验证了匹配几何结构的跨域迁移性。
CUADebug:计算机使用智能体故障的诊断与修复
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。
Comments 23 pages, 10 figures, 6 tables
SecRespond:面向真实入侵后事件响应的AI智能体基准测试集
专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。
EvoPINN:面向物理信息神经网络可执行算法的智能体式发现框架
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 EvoPINN是智能体式框架,将PINN开发转化为基于执行的算法发现,通过LLM智能体迭代优化,自主发明SLRC-PINN,可显著降低PDE求解的相对L₂误差,为科学计算提供新机制。
SARC-DQ:智能体AI的运行时数据质量门控:隐性证据缺陷、无能防护机制与仅下游修复
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究针对智能体AI的元数据缺陷问题,提出SARC-DQ运行时数据质量门控机制,实验显示模型能力未提升怀疑能力,所提门控结合下游修复可恢复部分损失,无模型预言机能精准跟踪缺陷率。
Comments https://github.com/besanson/dqSarc
$τ$-Rec:面向智能推荐系统的可验证基准
机构 * Independent Researcher(独立研究员) ; Princeton University(普林斯顿大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。
Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)
对时间、空间和语义规避的自主代理进行基准测试
机构 * Tsinghua University(清华大学)
专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出了一种针对基于大语言模型(LLM)的代理系统的多维规避框架,通过引入时间、空间和语义三种隐蔽攻击向量,系统地量化了这些威胁,并展示了其在实际威胁场景中的效果,揭示了现有自主代理系统在架构层面的系统性漏洞。
Comments 18 pages, 12 figures, 8 tables. Code and data available at https://github.com/antgroup/Agent3Sigma-Stage
用于基础设施即代码生成的智能语言模型的验证优先评估
专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。
Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2
AgentCompass:用于智能体能力的统一评估基础设施
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对大语言模型演变成自主智能体后评估基础设施分散的问题,提出AgentCompass,通过围绕三个独立组件组织评估过程,具备容错异步运行时和轨迹分析工具,支持多基准测试,为智能体研究提供可扩展、可重复的基础设施。
CyberGym-E2E:面向AI代理端到端网络安全能力的可扩展真实世界基准
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 提出CyberGym-E2E,一个大规模、真实的端到端网络安全基准,通过自动化流水线将开源漏洞数据转化为评估环境,全面评估AI代理在漏洞发现、PoC生成和补丁生成全生命周期中的能力。
Comments ICML 2026
OmniaBench:跨多样场景对通用人工智能智能体进行基准测试
专题命中 Agent评测 :AI agent(title);agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。
深入技能市场:从软件工程活动到可复用的智能体技能
机构 * The Hong Kong University of Science(香港科技大学) ; University of Chinese Academy of Sciences Beijing, China(中国科学院大学) ; Institute of Software, Chinese Academy of Sciences Beijing, China(中国科学院软件研究所) ; Zhejiang University Hangzhou, China(浙江大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 研究探讨软件工程活动如何转化为可复用智能体技能。通过对公共库和市场中SE技能大规模实证研究,分析其封装活动、生命周期覆盖等,发现SE活动正通过技能成为可复用工件,为技能推荐等提供研究机会及相关机制需求。
Terminus-4B:一个较小的模型能否在智能体执行任务中取代前沿大语言模型?
机构 * Microsoft USA(微软公司)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 研究智能体终端执行任务中较小模型能否取代前沿大语言模型。提出经监督微调及强化学习训练的Terminus-4B模型,评估发现其能减少主智能体令牌使用量约30%,不影响性能,还缩小与前沿模型差距甚至超越其性能。
Comments The current article involves some product IP issues and needs to be withdrawn and re-approved
CAGE-1:企业智能代理人工智能的控制、保证和治理评估
机构 * Independent technical report(独立技术报告)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 研究企业人工智能从实验转向运营工作流带来的评估问题,介绍CAGE-1评估框架,评估多方面内容,引入预绑定保证,用于判断企业代理是否可部署。
Comments 17 pages, 3 figures; independent technical report
PACE:智能体能力评估的代理框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。
SkillCoach: 用于评估和增强智能体技能使用的自演化评分准则
机构 * HKUST(GZ)(香港科技大学(广州))
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 提出SkillCoach框架,通过自演化过程评分准则从技能选择、遵循、组合和反思四维度评估智能体轨迹,并利用演化准则筛选高质量训练数据,提升技能使用能力。
面向可靠WebGIS开发的代理人工智能双螺旋治理方法
机构 * Geographic Information Systems Center, Florida International University(佛罗里达国际大学地理信息系统中心) ; Geospatial Analytics, Technology and Open Research Lab, University of Florida(佛罗里达大学地理空间分析、技术与开放研究实验室)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 针对代理AI在WebGIS开发中的不可靠问题,提出双螺旋治理框架,通过知识-行为-技能三轨架构和持久知识图谱外化事实与协议,实验证明能降低代码复杂度、减少输出方差并防止制图错误。
Comments Paper submitted to and under review in Transactions in GIS
EVOM:用于强化学习的演员-评论家架构的智能体元进化
机构 * Xidian University(西安电子科技大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 提出EVOM框架,通过双层优化(内环低保真PPO训练权重,外环LLM设计智能体驱动元进化)自动搜索高性能演员-评论家架构,在Ant-v4和HalfCheetah-v4上超越基线方法。
Counsel: 面向智能体任务的元评估数据集
机构 * Atla AI ; Cohere AI ; Mistral AI ; Google DeepMind(谷歌DeepMind)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。
专业化角色,混合部署:推动LLM代理团队的成本-精度前沿
机构 * University of Edinburgh(爱丁堡大学) ; Microsoft Research(微软研究院)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。
将意图转化为规范:一个基准测试和一个交互式用户助手代理
机构 * Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) ; IBM Core AI(IBM核心AI)
专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 提出SpecBench基准和Buddy代理,通过形态分析分解用户意图、模拟用户评估设计选择,将焦点从代码生成转向人机协作规范制定。
关于智能体安全的综述:应用、威胁与防御
机构 * BRAC University(布拉克大学) ; Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 本文首次全面综述智能体安全领域,围绕应用、威胁与防御三大支柱,分类260余篇论文,分析攻击入口、防御策略及生命周期覆盖,指出智能体系统默认结构脆弱,需全生命周期防御。
用于语义控制系统再综合的智能体MPC
机构 * University of Tokyo(东京大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 提出智能体MPC框架,通过集成大语言模型智能体实现上下文感知的语义自适应控制综合,在自动驾驶场景中验证其根据个人偏好或社交情境(如避让应急车辆)调整控制的能力。
Comments 7 pages, 5 figures