模型能说出苹果在画面左侧,不代表它能用绘图工具准确圈住苹果。北京大学、清华大学、商汤研究院提出EASEL,要求多模态智能体不断观察参考图和当前画布,再输出笔刷位置、颜色、粗细等参数,直到重建目标。
团队测试25个模型,主重建任务的相似度普遍停在0.40至0.54。许多模型前几步有所改善,继续操作后反而破坏已有结果。针对这一能力训练的EASEL-9B相对基础模型提升6.3%,在全部受测模型中排到第三。
把“看懂”变成一连串可执行参数
网页导航常把成功定义为点中一个较大的按钮,视觉问答只需输出文字。EASEL提高了动作精度要求:模型每一步都要读取参考图与画布,选择工具,并给出坐标、颜色、形状等连续或离散参数。动作执行后的新画布又成为下一步输入。
论文Figure 2:智能体观察参考图和当前画布,输出参数化工具动作,再接收执行结果。
重建任务覆盖自然图像、图标和其他视觉目标。评测既看最终图像相似度,也记录每一步轨迹,能区分模型是看错目标、参数不准,还是在闭环中没有利用新结果纠偏。
轨迹诊断还记录每一步达到的最佳分数。部分模型很早达到峰值,此后继续加笔导致相似度下降;另一些模型反复修改同一区域,却没有收敛。最终得分相近的两个模型,可能分别失败在初始规划和停止判断,训练策略也应不同。
画图之外还测标注、手写和路径规划
论文增加三类语义任务。区域标注要求准确圈出指定对象;手写要求把字符落到正确位置与形状;路径规划要求在迷宫或障碍场景中画出可行路线。这些任务共享“从视觉证据推断工具参数”的要求,却不依赖照片重建分数。
论文Figure 5:圆形标注、苹果区域标注、手写和迷宫路径任务的最佳模型结果。
样例显示,强模型可以识别起点与终点,却仍会让线条穿过障碍;能找到苹果,也可能把圆圈偏到背景。这类错误在文字回答中很难暴露,因为“知道应该圈苹果”和“把工具落在正确像素”是两项能力。
44万样本教模型先规划、再执行
EASEL-Data包含44万条样本,采用两阶段课程。数据先从约1.1万张参考图生成向量轨迹,再把完整轨迹拆成带中间画布的步骤,让模型学习当前状态下的下一次操作。
论文Figure 3:参考图经过向量轨迹生成、步骤拆分和质量过滤,形成两阶段训练数据。
EASEL-9B在这套数据上训练后,相对基础模型提升6.3%,但没有把问题解决:最终仍落后于最强模型,重建相似度也远未接近完美。结果支持专门轨迹监督有效,同时说明仅增加示范不足以建立稳定闭环控制。
下一步要看模型能否在真实软件里保持精度
EASEL选择受控画布,工具接口和反馈都很干净,便于测出参数误差。真实设计、标注和图像编辑软件还包含缩放、图层、撤销、吸附和快捷键,错误动作的代价更高。
论文Figure 1:从容差较大的交互到精细视觉工具执行,不同评测对动作精度的要求不同。
后续研究需要让模型识别“已经变好还是变差”,在越过最佳状态前停止,并在坐标或颜色偏差出现时局部修复。若这些能力能迁移到图像标注、矢量绘图和科学图表编辑,EASEL才会从受控代理任务走向可复用的软件操作能力。
真实软件评测还应保存可撤销的动作日志,并把误操作成本纳入分数。圈选偏几个像素与删除整个图层不能同罚;模型能否发现错误、撤销并恢复,也是闭环智能体区别于一次性脚本的关键指标。EASEL提供了参数化工具和轨迹基础,下一阶段可以在保持可复核性的前提下增加图层与多工具协作。
参考资料
https://arxiv.org/abs/2608.25417