arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

清华等提出CAP:420项跨站任务,最强商用浏览器Agent完整成功率仅6%

arXiv 2608.08392 cs.AI · cs.CL

清华大学、澳门科技大学、东南大学、爱丁堡大学和FellouAI等团队提出浏览器Agent基准CAP。它不只检查Agent能否打开页面并点击按钮,而是要求跨多个网站完成长流程,处理复杂控件和动态视觉内容。

CAP包含420项人工编写任务,覆盖8108个真实网站和24个领域。主表中,最强商用浏览器Agent Comet的部分完成率为48%,完整成功率仅6%。使用GPT-5的Browser-Use框架部分完成15%,完整成功2%。

一项任务同时考跨站、复杂操作和视觉感知

现有网页基准往往只有短流程,或不要求处理动态页面。CAP把难度拆成三个轴:跨站工作流、复杂执行动作和挑战性感知。一个任务可能需要先在一个站点找到商品信息,再去另一站点完成比较或规划,其间操作日期选择器、多级菜单、滑块和图像卡片。

CAP将跨站、复杂操作和视觉感知组合到同一任务

CAP的三个难度轴包含动态页面、复杂UI和可验证的跨站结果。

先把网站抽象成卡片,再重组成长流程

团队先为每个站点建立“站点卡”,记录用户可见功能、执行操作和感知需求;随后将多张卡片的组件重组为合理的跨站任务。这样一来,每项任务都能回溯到具体操作,失败时也可以区分是规划、点击还是感知出错。

CAP从站点卡到跨站任务的构建流程

构建流程将站点功能分解后重组,再经人工质量控制。

CAP列出88种复杂动作类型,包括层级级联选择、日期时间、拖动和布局内滚动;感知任务则涉及工具提示、图像特征、状态徽标、图中文字和跨图比较。这些都是真实网站中常见,却很难用纯DOM文本解决的环节。

部分完成看起来不低,一到全流程就断层

Comet的部分完成率48%为表中最高,复杂动作完成67%,复杂感知完成58%,但最终完整成功率只有6%。这个差距说明,长流程中任何一个局部错误都可能让整个任务无法交付。

CAP的可验证Agent评价流程

评价器先利用任务知识生成验证代码,再检查网页状态与输出。

人类参考的完整成功率为10%,同样不高,表明CAP选的就是高复杂度任务。因此,6%不应外推为Comet处理日常简单网页也只有6%成功率。

主表还显示了不同Agent的时间和输出长度取舍。Comet平均用6.5分钟,输出约10.436万Token;Fellou部分完成24%,完整成功7%,却平均用22.1分钟。Browser-Use加Claude-4.5-Sonnet部分完成21%、完整成功5%,平均用29.9分钟。更长的思考或输出没有自动变成更高的整体交付率。

为避免“评委模型偏爱某个Agent”,团队用GPT-4o、Claude-Opus-4.8、GLM、Qwen3-235B和DeepSeek-V4-Flash等不同判定骨干复核部分完成率。Comet、人类和DeepSeek驱动Agent的排名在五个评委下保持一致。这不能消除自动评价的所有偏差,但说明主要结论并不依赖某一个Judge。

数据质量控制也不只核对任务文本。团队为每个站点组件检查操作是否仍然可用,核对跨站步骤的前后依赖,并为最终状态准备可执行的验证逻辑。这一设计使Agent即使用了不同路径,只要真正达成结果,仍能被判定成功。

下一步让Agent学会在局部错误后恢复

因为任务涉及真实站点,基准后续还需要持续维护页面改版、登录状态和动态内容带来的变化。站点卡的好处是可以单独更新某个组件和验证器,而不必把所有420项任务全部重写。

CAP的价值不只是再排一张Agent榜单,而是把执行和感知拆成可诊断部件。研发者可以看到Agent是不会拖动滑块,还是无法识别图像中状态,再针对性增加视觉感知、状态记忆和恢复策略。

CAP中不同类型复杂操作与感知任务的得分分布

分类结果可以定位浏览器Agent在特定UI和感知类型上的能力差距。

对产品化Agent而言,下一步不只是把单步点击做对,还要能发现页面没有按预期变化,回退、重新定位并继续跨站流程。CAP提供了检验这类闭环能力的可重复起点。

参考资料

https://arxiv.org/abs/2608.08392

https://warriorxu0302.github.io/CAP-Bench/