阿里巴巴MAI-UI团队发布Qwen-UI-Agent技术报告,把手机、电脑、网页和DeepSearch任务放进同一套GUI智能体体系。论文报告的27B版本在MobileWorld-Real实机手机测试中取得92.2%的成功率,在AndroidDaily上达到97.5%。
这套系统支持超过100轮的在线强化学习轨迹,并行运行的训练环境超过1万个。它还把屏幕点击、滑动等GUI操作与命令行执行放进统一动作空间,允许模型在一次输出中生成一批连续操作。
论文图2:Qwen-UI-Agent在手机和电脑之间衔接任务,并保存跨平台工作状态。
409个实机任务覆盖104款应用
现有手机智能体经常在可重置的模拟器里训练和评测。真实手机会出现登录过期、弹窗、验证码、网络变化和动态内容,同一个任务也很难恢复到完全相同的初始状态。
阿里为此构建了MobileWorld-Real。测试集包含409个端到端任务,覆盖104款中国移动应用,分为内容消费、生活服务、办公、电商、系统设置、金融服务和社交通信七类。任务由人编写,并在带有真实账户、网络和应用内容的Android设备上执行。
论文图7:MobileWorld-Real覆盖七类日常需求,并在真实Android应用、账户和网络中运行。
近一半任务被标记为困难,常见要求包括跨应用协作、深入多层入口、比较多个结果、应对弹窗以及在信息变化后重新规划。团队还把全部评测轨迹留存下来,便于事后检查环境错误和模型行为。
GUI负责看,命令行负责批量处理
Qwen-UI-Agent并未把所有动作都交给鼠标和触屏。对需要识别页面状态、确认视觉结果的步骤,模型使用GUI;对文件处理、系统查询等更适合脚本执行的任务,它可以调用命令行。批量动作减少了每一步都重新截图、推理和点击的往返成本。
训练流程分为监督微调、动作级强化学习和在线强化学习。一个由智能体驱动的数据循环负责生成任务与环境、分析失败原因,再安排下一轮数据。团队同时设计了轻量运行框架,用于保存任务状态、跨设备衔接流程和主动启动服务。
论文图3:训练基础设施同时连接移动端、电脑、浏览器和DeepSearch沙箱,并加入真实设备运行环境。
论文报告称,Qwen-UI-Agent在MobileWorld取得82.1%,在桌面任务OSWorld-Verified取得79.5%,OSWorld-v2部分进度分为40.0%,WebArena网页任务为73.6%。这些数字来自不同基准,评分方式、步数限制和任务环境并不统一,不能把它们横向当成同一种成功率。
论文图8:一次真实手机任务连续调用高德地图、大众点评和小红书,图中保留了关键步骤。
实机高分仍由AutoJudge判定
真实手机无法像模拟器那样直接读取每个第三方应用的内部状态,MobileWorld-Real使用AutoJudge查看完整操作轨迹并判断通过、失败或环境错误。论文在666个专家复核样本上测得92.8%的完全一致率,余下误差仍会影响最终成绩。
团队明确承认,目前的自动化研发流程仍需要大量人工监督和纠错。35B-A3B版本的部分训练尚未完成,高保真合成环境也没有纳入本次报告。长任务还存在累计延迟:每个GUI步骤都要经历新截图、模型推理和环境响应,任务越长,等待越明显。
论文图19:同一任务中,在线强化学习后的策略会重新打开应用核对结果并修正错误。
这份报告证明的是一套研究系统在规定基准中的表现,并未给出面向普通用户的上线时间、价格或完整产品形态。92.2%的实机成绩让GUI智能体离真实设备更近,但自动裁判误差、执行速度和人工维护成本仍会决定它能否稳定进入产品。