arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.17319cs.AI

Wuying-Browser-Agent:以真实场景为中心的基础长时程浏览器智能体

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

AIMAE Team, Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma, Long Peng, Xiaobing Tu, Yinggui Wang, Hongliang Wei, Chen W… 展开作者

AIMAE Team, Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma, Long Peng, Xiaobing Tu, Yinggui Wang, Hongliang Wei, Chen Wu, Daiping Xin, Kunyu Zhou, Pengyang Zhou, Peiyuan Chen, Ziyuan Chen, Yutao Deng, Chunyu Dong, Xiangyu Fu, Yicheng Feng, Ruian He, Haochen Li, Miancan Liu, Zhengqin Liu, Wei Peng, Jinkui Ren, Haoyu Tan, Dong Xiao, Rongkun Xue, Shujian Yang, Xianhang Ye, Ziqi Yuan, Ziyang Yu, Linghan Zhang, Xiantao Zhang, Xuanpu Zhao, Yinan Zhao, Zhenghui Zhao, Bin Zhu, Likai Zou

首次发表
浏览论文内容

中文总结 AI 辅助

本文提出Wuying-Browser-Agent统一框架,通过多层面技术对齐解决浏览器智能体实际部署问题,在多项基准取得最优成绩,且具备通用智能体迁移能力。

中文摘要 AI 辅助

浏览器智能体在简短、干净的演示任务中表现良好,但实际部署场景存在根本差异:智能体必须在实时网站上持续做出数十次决策,同时从错误中恢复并导航复杂的用户界面(UI)。本文认为,缩小这一差距需要在执行、监督、优化和评估等流程的各个层面进行对齐,而非仅靠规模提升。我们提出Wuying-Browser-Agent,一个解决上述各层面问题的统一框架:结构化浏览器工具提供稳定的执行原语和面向决策的上下文管理;结合恢复轨迹与复杂UI交互的反思及UI专用课程监督微调(RUIC-SFT)实现针对性训练;通过基于潜能的奖励塑形和感知分歧的步长加权,提出感知分歧的在线广义比率策略优化(DAO-GRPO)以改进长时程信用分配;最后,我们引入BrowserBench,一个包含350项任务、平均步骤数为37.9的双语真实网页基准,因多数现有基准过短,无法暴露长时程失败模式。Wuying-Browser-Agent-27B在WebVoyager上取得80.6%的成绩,在Online-Mind2Web上取得66.7%,在BrowserBench上取得65.1%,成为浏览器使用基准上新的开源最优水平;同一流程还可迁移至浏览器使用之外的场景,在Tau2-Bench、Claw-Eval和BFCL-v4上的平均得分达73.8,展现出强大的通用智能体能力。

英文摘要

Browser agents perform well on short, clean demonstrations, but real deployment is fundamentally different: agents must sustain dozens of decisions on live websites while recovering from mistakes and navigating complex UIs. We argue that closing this gap requires alignment at every level of the pipeline, including execution, supervision, optimization, and evaluation, rather than scale alone. We present Wuying-Browser-Agent, a unified framework that addresses each of these levels. A structured browser harness provides stable execution primitives and decision-oriented context management. Reflection and UI-specialized Curriculum SFT (RUIC-SFT) explicitly trains on recovery trajectories and complex-UI interactions. Divergence-Aware Online GRPO (DAO-GRPO) improves long-horizon credit assignment through potential-based reward shaping and divergence-aware step weighting. Finally, we introduce BrowserBench, a bilingual real-web benchmark of 350 tasks averaging 37.9 steps, because most existing benchmarks are too short to expose long-horizon failure modes. Wuying-Browser-Agent-27B achieves 80.6\% on WebVoyager, 66.7\% on Online-Mind2Web, and 65.1\% on BrowserBench, establishing a new open-source state of the art on browser-use benchmarks. The same pipeline also transfers beyond browser use, demonstrating strong general agentic ability and reaching an average score of 73.8 on Tau2-Bench, Claw-Eval, and BFCL-v4.

发表机构

  • Alibaba Cloud(阿里云)
  • End-User Intelligent Computing BU(终端用户智能计算业务部)
  • AI Model Application & Engineering Team(AI模型应用与工程团队)

机构由 AI 辅助整理,请以论文原文为准。

↑