arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

谷歌WebRider揭开网页智能体假完成:99.2%交差,只有38.8%守规矩

arXiv 2608.06704 cs.AI · cs.HC

网页智能体点完几下按钮,再返回一句“任务完成”,并不代表它真的按用户要求做对了。谷歌与加州大学洛杉矶分校推出WebRider,在42个真实网站上构造4096份可检查的“意图合同”。最强配置有99.2%的任务能够正常停机,但同时满足全部合同门槛的比例只有38.8%。

把一句需求拆成可验收合同

常见网页基准只检查终点,例如购物车里是否出现商品。真实委托却包含大量隐性边界:必须选可退款酒店、不能超过预算、只可查看不能提交,或者答案必须附带页面证据。智能体若到达近似终点却越过限制,表面完成,实际已经违约。

WebRider把自然语言委托编译为分层意图合同。最上层写明最终目标;中间层把允许的网页动作表示为带条件的Action AST;最底层连接浏览、点击和输入工具。相同任务还能配上不同用户画像与路线要求,让系统不只回答“有没有做”,还检查“是否按这个人的规则做”。

WebRider分层合同与智能体执行架构

目标、动作约束与工具执行被分层记录,每一步都可以回到合同条款验收。

99.2%停机,38.8%全部过关

研究在真实、持续变化的网站上执行任务,并设置从宽到严的多道门槛。完整配置Full-Pro有99.2%的轨迹能结束,说明模型很少陷入无限循环;但硬约束通过率为70.3%,证据要求通过率为57.4%,答案质量为42.3%,全部门槛同时通过只剩38.8%。

这组落差揭示了“终止率”的迷惑性。智能体可以很流畅地浏览、生成一段看似合理的总结,甚至抵达正确页面,却遗漏价格限制、引用了无法核实的信息,或在不该提交时跨过确认按钮。只用最终文本做裁判,会把不少违规轨迹当成成功。

一条网页任务轨迹如何经过合同审计

WebRider保留动作证据,使失败可以定位到具体门槛,而非只得到一个总分。

人工复核看见了哪些“假完成”

论文还对自动审计结果进行人工核查。典型问题包括智能体在弹窗或登录步骤反复尝试、抓到相关页面却没有找到能支持答案的字段,以及为了尽快给出结论而放宽用户条件。有些轨迹的网页操作并非完全错误,但最后回答把不确定信息写成确定事实,同样不能通过证据门槛。

WebRider的人类审核样例与通过情况

人工审核用于确认合同门槛确实对应用户意图,而不是自动规则自行制造失败。

团队也尝试训练8B模型使用受约束接口。与只学习“可执行动作”的版本相比,显式接触合同和守卫条件的模型更能遵守边界。这意味着提升网页智能体不只是继续扩大模型或增加演示轨迹,还可以把可检查的用户约束直接放进训练与执行层。

合同还能改善调试方式。过去一条失败轨迹往往只留下“答案不对”,开发者很难判断是导航、证据还是权限出了问题;现在每道门槛都有对应状态,错误可以定位到某次动作和某条约束。对高风险网页操作而言,这种可追溯性与总成功率同样重要,因为它决定团队能否复现错误、设置拦截并向用户解释为何没有继续执行。

下一步走向可审计网页智能体

WebRider的重要变化,是把成功定义从“网页状态看起来对”推进到“目标、过程、证据和答案共同成立”。这类设计更接近机票预订、保险查询和企业后台操作的真实风险:用户关心的不只是结果,还关心预算、权限和不可逆动作是否被尊重。

下一步可以把合同守卫接入机票预订、保险查询和企业后台等真实流程:智能体执行前展示不可越过的预算、权限与提交边界,执行后交付逐条可核验的证据。合同状态还能为人工接管提供明确位置,不必从整段浏览日志中重新寻找错误。

真实网站会改版并限制自动访问,合同质量也会影响验收结果。WebRider已经给出一套可复用的训练与审计接口;如果后续任务能覆盖更多不可逆操作和企业权限系统,网页智能体的评价就能从“是否点到终点”进一步转向“是否按照委托可靠交付”。

参考资料

https://arxiv.org/abs/2608.06704

https://huggingface.co/datasets/WebRider/WebRider