论文导读
Adobe与布朗大学提出Designer-RSI:不更新模型权重,让设计智能体从自己完成和失败的任务中扩展外部技能库。五轮演化后,技能从76项增至139项;在Claude-Sonnet-4上的GenEval2执行成功率由72.7%升至99.3%,能力变化也能逐项检查。
不重训模型,改写可复用的操作流程
许多设计智能体能调用绘图、排版和图像编辑工具,但遇到新任务时通常只依赖提示词里的临时推理。任务结束后,成功经验不会留下,失败的步骤也不会被系统性修正;下一次面对相似需求,智能体可能重新走一遍弯路。
Designer-RSI把这种经验存成“程序性记忆”。技能不是一句抽象建议,而是包含适用条件、执行步骤与工具调用方式的流程。模型、设计工具和渲染器保持冻结,变化发生在外部技能库,因此团队能检查智能体究竟新增或改写了什么。
图:论文框架展示任务执行、结果评估与技能库更新之间的循环。
成功经验扩宽技能,失败轨迹加深修订
框架把学习分成两种动作。Widening从新的成功轨迹中提炼此前没有的技能,让能力覆盖面变宽;Deepening则分析失败或不稳定的执行过程,补充前置条件、调整步骤,或把过于笼统的技能拆细。二者都发生在任务之后,不干扰当次设计交付。
研究使用1406个设计简报完成五轮演化。技能库由76项增长到139项,并不是简单保存所有历史轨迹:系统还要判断新经验是否与已有技能重复,选择新增、合并或重写。这个机制更像维护一份持续更新的团队操作手册。
图:论文案例展示智能体如何根据执行反馈扩写或修订技能。
99.3%说明执行更稳,不等于设计判断完美
在论文设置中,Designer-RSI把Claude-Sonnet-4的GenEval2执行成功率从72.7%提高到99.3%。这个数字衡量的是设计任务能否按要求完成和产出,不应被解释为所有作品的审美质量都接近满分。主要结果依赖自动评测与内部用户任务,评审口径仍决定什么算“成功”。
外部技能也可能积累偏差。如果一次偶然成功被总结成通用规则,错误会在后续任务中重复;不同工具版本、品牌规范或用户偏好变化,也可能让旧技能失效。因此技能库需要来源记录、适用范围、回滚和定期淘汰,而不是只追求条目数量。
图:论文展示设计智能体执行任务后的视觉结果,用于核对流程技能的实际作用。
下一步:把技能库变成可审计的团队资产
这项工作最直接的价值,是给“智能体持续学习”提供一种不改权重的工程路径。企业可以先在低风险设计任务中运行:保留每次技能变更的触发任务、评估结果和人工批准人,再逐步允许系统自动选择经过验证的流程。
更严格的测试应把训练简报和新领域任务分开,检查技能能否跨项目迁移,并让专业设计师评价构图、品牌一致性和可编辑性。还需要比较技能库增长带来的检索成本:条目越多并不必然越好,找到正确流程、识别冲突和拒绝过期技能同样重要。
如果这些治理环节补齐,程序性记忆可以成为设计团队共享的“第二层能力”:大模型负责理解新需求,外部技能负责沉淀可靠做法。它不会替代设计判断,却能让智能体少重复犯错,也让能力变化比一次不可见的模型更新更容易追踪。