腾讯Hy Frontier团队提出开源GUI智能体UI-Mate:用户先录一遍操作,它把录像整理成可复用的子任务流程,再对着实时屏幕执行。论文在OSWorkerBench的33项同任务示范子集中报告,一次示范将严格成功率从17.2%提高到35.4%,进度分从67.9%升至81.1%。
这项工作针对一个很具体的问题:办公任务往往没有唯一做法。用户说“核对录用决定并通知候选人”,实际还包含表格位置、文件命名、邮件模板和公司内部工具等隐含习惯。把所有步骤写进提示词,成本可能和自己操作一遍相当;只给目标,智能体又容易在不同运行中走出不同流程。
把屏幕录像变成可以调整的子任务清单
UI-Mate没有把演示当成必须逐点击重放的宏。系统先将一段人类或智能体录像切成子任务,为每个子任务提取目标、完成条件和带视觉线索的操作说明。执行时只把当前相关部分交给模型,并让实时截图保留最终决定权。
UI-Mate把多模态操作演示转成可执行工作流,并在实时界面中继续规划。
这使示范可以跨相近任务复用。按钮换了位置、目标文件不同,模型不必照搬旧坐标,而是寻找当前界面中的对应元素;示范遗漏低层动作时,它可以自行补齐。论文还专门加入演示与当前屏幕不一致的训练样本,避免模型把错误示范当成硬指令。
训练数据必须和可执行环境一起生产
GUI轨迹只有在初始环境能够复现、操作真正执行、最终状态可以验证时才有训练价值。UI-Mate搭建闭环数据引擎,从任务生成、环境构建、智能体运行、过滤到验证器打包一起处理,再用能力树检查哪些应用、操作和长流程样本不足。
UI-Mate的数据飞轮把任务、环境、轨迹、验证器和训练连接起来。
团队据此完成监督微调和在线强化学习。训练重点不只是鼠标落点,还包括跨应用传递信息、在长轨迹中保持状态,以及执行失败后的恢复。UI-Mate-27B在OSWorld-Verified得到77.0%,WindowsAgentArena得到66.2%;论文将其描述为对比系统中的开源权重最佳结果,而不是所有闭源电脑智能体的统一排名。
100项办公任务专门测试长记忆和跨应用协作
团队同时发布OSWorkerBench,包含41款应用、10类工作岗位下的100项长流程任务。其中67项要求在后续步骤重新使用早先出现的信息,49项需要在至少三个应用之间传递内容。评测既看任务是否完整成功,也记录完成到什么程度。
OSWorkerBench从任务设计、环境搭建到可执行验证的构建流程。
在该基准上,UI-Mate-27B严格成功率为41.0%,进度分为76.9%,分别比Qwen3.6-27B基础模型高17.7和24.5个百分点。同任务演示子集上的35.4%仍说明多数任务没有完全完成;它证明示范能减少歧义,却没有消除网页变化、长程错误累积和验证器覆盖不足。
值得注意的是,严格成功率和进度分回答的是两个不同问题:前者要求整条流程全部完成,后者允许统计已经正确完成的部分。两者之间的差距暴露出长任务最典型的瓶颈——智能体通常不是第一步就失败,而是在跨应用复制信息、等待页面响应或处理弹窗时逐渐偏离。对企业用户而言,这也意味着评估自动化工具不能只看演示视频,更应检查完整任务通过率、失败位置和人工接管频次。
从研究原型走向个人工作流助手
项目页展示了录制演示、转换工作流和在桌面端执行的完整界面。适合落地的方向不是让模型无条件控制整台电脑,而是从规则明确、可验证的重复流程开始,例如整理表格、跨系统录入、生成固定格式文件,并保留每一步截图和结果检查。
UI-Mate应用由录制、工作流转换、实时观察和动作执行组成。
下一步的关键是把“完成条件”做得和动作模型一样可靠。若验证器只确认文件存在,却没有检查内容正确,智能体仍可能得到错误奖励。论文提出继续研究过程级进度判断、不同任务之间的示范迁移和更安全的本地部署,这些环节将决定GUI智能体能否从榜单成绩进入日常办公。