arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Patronus AI记录200小时Figma设计过程,训练智能体学会人类工作流

作者:arXivDaily编辑部 arXiv 2608.21460 cs · cs.AI · cs.CV

给模型一张优秀网页截图,它能学到最终像素,却看不到设计师如何选图层、建样式、调整间距、撤销错误。Patronus AI推出FigmaTrace,记录超过200小时的人类Figma操作视频,将其转换为3469条设计轨迹,覆盖126项开放式长程任务。

论文关注的是带主观判断的创意工作流,不是按钮定位基准。团队同时给出设计技能分类、专家解法和训练后的Qwen3.8-27B模型;评分仍依赖人工量表与多模态评审,不能把单次高分写成模型已经具备通用审美。

轨迹里保留设计师真正做过的动作

采集系统同步保存屏幕视频、鼠标键盘事件和Figma状态。轨迹可以复现输入色值、选择图层、切换面板、创建样式和检查结果等操作。相比只保存前后截图,它保留了中间试错与顺序信息。

论文Figure 1:从输入色值、创建样式到切换选项和检查结果的一段Figma操作序列。

126项任务不是简单的“把按钮点到指定位置”。它们要求制作或修改真实设计,答案可能有多种,成功标准包含视觉层级、一致性、可访问性、交互流程和完成度。

先把设计能力拆成可检查的技能

团队邀请专家整理技能分类,包括视觉感知、Figma结构操作、排版适配、内容与边界推理、可访问性、交互流程、资产选择、矢量绘制、原型制作和诊断修复。每类技能继续细分,形成任务构造和评价依据。

论文Figure 2:覆盖视觉、结构、适配、可访问性、资产、原型与诊断等能力的分类体系。

这种分类不会自动消除主观性,但能把“看起来不够好”拆成可讨论的具体问题。例如页面层级混乱、组件未复用、颜色对比不足和交互状态缺失,会落到不同评分项。

按设计阶段切轨迹,比按长度硬切更有效

长达数十分钟的录屏不能直接塞进训练上下文。FigmaTrace根据操作目的识别构图、组件搭建、样式调整、内容替换和收尾检查等阶段,再把视频转成动作轨迹。这样切分能保留一段操作的局部目标,避免在固定长度边界上把“选择对象”和“修改对象”拆开。

论文Figure 3:常见鼠标键盘动作与设计阶段的频次分布,展示数据集中不同操作结构。

消融实验比较按设计阶段切分与按长度切分。前者在跨环境任务上表现更好,论文据此把提升的一部分归因于轨迹组织方式,而不只归因于训练数据总量。

数据中的动作以鼠标点击、键盘输入和移动为主,设计阶段中组件搭建占比最高。这个分布反映当前任务与专家工作方式,不代表所有设计项目都具有相同比例;移动端原型、插画和复杂动效可能需要另一套轨迹结构。

训练后在四个外部分布环境测试

团队训练四个模型,并在四个没有直接出现在训练分布中的GUI环境评估。表格中,Qwen3.8-27B经FigmaTrace微调后在多项环境取得明显提升,部分分数接近论文选取的闭源模型。

论文Tables 2–3:不同模型在四个GUI环境上的表现,以及按阶段切分与其他训练设置的比较。

“接近闭源模型”只对应这组任务和评审协议。设计结果的可用性还受字体、版权素材、品牌规范和用户研究影响,论文没有把这些生产约束全部纳入自动评分。

模型分数还受操作是否能被GUI环境稳定执行影响。视觉结果好但图层结构混乱,后续编辑成本仍可能很高;结构规范但审美普通,也会在主观评分中吃亏。FigmaTrace尝试同时覆盖两类要求,评价仍需人工抽查。

论文Figure 4与Table 4:技能标签频次及人工标注抽查结果。

下一步是让过程数据进入真实团队协作

FigmaTrace可用于训练设计助手学习操作顺序,也可作为研究人类工作流的行为数据。数据集和模型页已经公开,后续需要核验许可证、任务素材来源以及模型在新品牌系统中的泛化。

真正进入产品后,智能体还要解释自己改了什么、保留可撤销历史,并让设计师在关键审美选择上接管。过程轨迹提供了这类协作的基础,但不会替代设计评审和用户反馈。

参考资料

https://arxiv.org/abs/2608.21460

https://arxiv.org/html/2608.21460

https://huggingface.co/datasets/PatronusAI/figmatrace

https://huggingface.co/PatronusAI/Qwen3.8-27B-Figmatrace-SFT