清华大学、澳门科技大学、东南大学、爱丁堡大学和FellouAI等团队提出浏览器Agent基准CAP。它不只检查Agent能否打开页面并点击按钮,而是要求跨多个网站完成长流程,处理复杂控件和动态视觉内容。
CAP包含420项人工编写任务,覆盖8108个真实网站和24个领域。主表中,最强商用浏览器Agent Comet的部分完成率为48%,完整成功率仅6%。使用GPT-5的Browser-Use框架部分完成15%,完整成功2%。
一项任务同时考跨站、复杂操作和视觉感知
现有网页基准往往只有短流程,或不要求处理动态页面。CAP把难度拆成三个轴:跨站工作流、复杂执行动作和挑战性感知。一个任务可能需要先在一个站点找到商品信息,再去另一站点完成比较或规划,其间操作日期选择器、多级菜单、滑块和图像卡片。
CAP的三个难度轴包含动态页面、复杂UI和可验证的跨站结果。
先把网站抽象成卡片,再重组成长流程
团队先为每个站点建立“站点卡”,记录用户可见功能、执行操作和感知需求;随后将多张卡片的组件重组为合理的跨站任务。这样一来,每项任务都能回溯到具体操作,失败时也可以区分是规划、点击还是感知出错。
构建流程将站点功能分解后重组,再经人工质量控制。
CAP列出88种复杂动作类型,包括层级级联选择、日期时间、拖动和布局内滚动;感知任务则涉及工具提示、图像特征、状态徽标、图中文字和跨图比较。这些都是真实网站中常见,却很难用纯DOM文本解决的环节。
部分完成看起来不低,一到全流程就断层
Comet的部分完成率48%为表中最高,复杂动作完成67%,复杂感知完成58%,但最终完整成功率只有6%。这个差距说明,长流程中任何一个局部错误都可能让整个任务无法交付。
评价器先利用任务知识生成验证代码,再检查网页状态与输出。
人类参考的完整成功率为10%,同样不高,表明CAP选的就是高复杂度任务。因此,6%不应外推为Comet处理日常简单网页也只有6%成功率。
主表还显示了不同Agent的时间和输出长度取舍。Comet平均用6.5分钟,输出约10.436万Token;Fellou部分完成24%,完整成功7%,却平均用22.1分钟。Browser-Use加Claude-4.5-Sonnet部分完成21%、完整成功5%,平均用29.9分钟。更长的思考或输出没有自动变成更高的整体交付率。
为避免“评委模型偏爱某个Agent”,团队用GPT-4o、Claude-Opus-4.8、GLM、Qwen3-235B和DeepSeek-V4-Flash等不同判定骨干复核部分完成率。Comet、人类和DeepSeek驱动Agent的排名在五个评委下保持一致。这不能消除自动评价的所有偏差,但说明主要结论并不依赖某一个Judge。
数据质量控制也不只核对任务文本。团队为每个站点组件检查操作是否仍然可用,核对跨站步骤的前后依赖,并为最终状态准备可执行的验证逻辑。这一设计使Agent即使用了不同路径,只要真正达成结果,仍能被判定成功。
下一步让Agent学会在局部错误后恢复
因为任务涉及真实站点,基准后续还需要持续维护页面改版、登录状态和动态内容带来的变化。站点卡的好处是可以单独更新某个组件和验证器,而不必把所有420项任务全部重写。
CAP的价值不只是再排一张Agent榜单,而是把执行和感知拆成可诊断部件。研发者可以看到Agent是不会拖动滑块,还是无法识别图像中状态,再针对性增加视觉感知、状态记忆和恢复策略。
分类结果可以定位浏览器Agent在特定UI和感知类型上的能力差距。
对产品化Agent而言,下一步不只是把单步点击做对,还要能发现页面没有按预期变化,回退、重新定位并继续跨站流程。CAP提供了检验这类闭环能力的可重复起点。