arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

蚂蚁把手机、电脑和网页智能体合成一个,平均成功率51.2%

arXiv 2607.29320 cs.AI

蚂蚁集团团队提出MAGA,把分别擅长手机、桌面和网页操作的GUI智能体蒸馏到同一个Qwen3-VL模型中。8B版本在三套基准上的平均成功率为51.2%,比论文中最强的统一模型基线高2个百分点,接近三个领域教师模型50.9%的平均水平。

统一模型在OSWorld和WebVoyager上略高于对应教师,在MobileWorld上仍低3.4个百分点。结果来自公开基准,不代表系统已经接入支付宝或其他蚂蚁产品。

三类GUI基准中的教师分歧与最终成绩

论文图1:模型合并在高分歧任务上明显掉分;MAGA在三个基准中取得最高的统一模型成绩。

专家权重相加,动作可能直接被破坏

手机、桌面和网页智能体使用相近的视觉语言模型,却面对不同动作语法。手机常见点击、滑动,桌面环境还包含键盘、窗口和文件操作,网页任务依赖页面元素与浏览路径。

研究团队从900个样本中找到66个领域教师高度分歧的任务。直接合并模型权重后,这些任务的成功率下降10%至24%。不同教师对同一画面给出不同动作时,权重平均很容易生成一个谁都没有执行过的折中动作。

权重合并、普通蒸馏和MAGA的差别

论文图2:MAGA按动作结构重新分配训练信号,并用只在训练期出现的提示改善教师输出。

动作只占输出的4%到7%

普通在线策略蒸馏会逐Token模仿教师,把长推理和短动作视为同等重要。论文统计显示,8B学生模型的动作Token只占响应的3.9%至7.1%,其余92.9%至96.1%都是推理文本。

MAGA先判断学生动作是否正确。整条动作正确时,不再重复蒸馏;动作类型正确但参数错误时,放大完整动作片段的监督;连动作类型都错时,只强化类型Token,并遮掉后续参数,避免学习建立在错误动作之上。

训练期还会给教师一个额外提示,要求它针对学生失败生成更合适的监督。部署时学生仍接收原始任务,接口没有增加这段提示。

8B模型超过对应教师的两个基准

MAGA-8B在MobileWorld、OSWorld和WebVoyager上的成功率分别为34.2%、45.3%和74.3%。对应教师为37.6%、42.8%和72.1%;最强统一基线UI-MOPD的平均成功率为49.2%。

训练后动作正确率和行为来源

论文图3:学生不只复制对应领域教师,也会采用其他教师动作或生成教师未给出的正确动作。

在每个领域300条留出样本中,完整动作正确率由42.2%升至63.2%,动作类型错误由30.9%降至14.6%。MobileWorld高分歧样本里,点击动作相对权重合并提高17.2个百分点,滑动提高10.8个百分点。

只纠正动作类型后的参数恢复情况

论文图4:动作类型被纠正后,模型重新生成参数,部分原本失败的动作可直接恢复。

平均追平教师,不等于每个平台都追平

51.2%是三套基准的平均值。MobileWorld仍落后专用教师,2B版本的平均成功率也只有25.3%。论文使用117个手机任务、369个桌面任务和140个网页任务,动作正确性依赖各基准的自动检查器。

MAGA验证了多领域模型整合时应优先保护可执行动作,但还没有测试真实账户、长期连续任务、系统更新和高风险操作。统一模型是否能替代多个线上专家,仍取决于失败恢复、权限控制和环境变化下的持续评测。

参考资料

https://arxiv.org/abs/2607.29320