论文导读
浙江大学与电子科技大学提出EvoSkill-GUI,让操作手机和电脑的智能体在部署时根据失败轨迹修改Skill,不增加模型训练。它在MobileWorld、AndroidWorld和OSWorld上对多个基础模型带来提升,三项基准的最大增益分别为16.2%、6.0%和10.5%;最大值并不代表每个模型、每项任务都同幅上涨。
GUI变一下,预先写好的步骤就可能失效
网页和App会弹出提示、延迟加载或移动按钮。若Skill只保存一条固定步骤,智能体一旦点错,后面的动作会继续累积偏差。EvoSkill-GUI把技能做成结构化多文件包:元数据负责检索,计划描述主路径,backup与recover文件处理定位和恢复,失败案例则保存已知负面经验。
图1:项目页展示的GUI任务执行案例。
Skill因此不再是部署前写完就冻结的提示词,而是一套能被局部编辑的程序性知识。观察也不只包含截图,还结合可访问性树,智能体可读取控件结构,并在图像定位不稳定时换用更可靠的界面信息。
反思、修订、复用,失败经验被写回技能库
框架把运行分成执行、进程内修订、隔离批评和运行后更新。执行器遇到失败可以先做局部修改;隔离的critic只根据轨迹、指令和当前Skill诊断原因,不能偷看正确答案或外部真值;最后,执行器通过受限工具接口修改指定文件,再重新运行。
图2:Skill包保存计划、备份、恢复和失败案例,修订循环持续写回。
“信息隔离”很重要。若批评器直接看到答案,它可能给出无法在真实部署中获得的提示,基准分数也会失真。受限编辑则避免智能体随意重写整个系统,使改动可以追踪到具体计划、恢复规则或失败案例。
下一步:把会进化的Skill带进真实软件
实验覆盖MobileWorld、AndroidWorld和OSWorld三类移动端与桌面端任务。多个基础模型在不训练参数的情况下得到改善,报告的最大增益分别为16.2%、6.0%和10.5%。演化后的技能库还能帮助相关任务,不必每次从零构建。
图3:连续界面展示智能体离开错误路径、重新打开文档并完成分享。
这不意味着系统会无限自我提升。错误诊断可能不准,错误经验也可能污染后续任务;基准环境比真实软件的版本变化和账号风险更受控。论文的实用启示是:GUI智能体除了更强模型,还需要可审查、可回滚、能积累失败知识的Skill生命周期。部署到支付或企业系统时,仍应限制写权限,并对每次技能修改做人工或自动验证。实际产品还要解决Skill版本冲突、跨账号隐私和错误经验撤销,让一次任务学到的规则不会在另一套界面上造成新的连锁失败。
一个可行方向是把每次修订放入沙箱回放,只有通过旧任务回归与新任务验证的改动才进入共享技能库;高风险应用还应保留人工批准和一键回滚能力。
参考资料
https://arxiv.org/abs/2609.17653
https://arxiv.org/html/2609.17653