arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

快手&港中文提出AMFD,单步生成超越多步FLUX.2 4B教师模型

作者:arXivDaily编辑部 arXiv 2607.26860 cs · cs.LG

快手科技影幻团队与香港中文大学MMLab联合提出AMFD(Amortized Fréchet Distance),一种用于视觉生成的分布匹配方法。在文本到图像生成任务上,AMFD训练的单步模型在GenEval基准上达到了0.846,超过了其多步教师模型FLUX.2 [klein] 4B的0.794,同时PickScore保持同等水平。这意味着单步扩散模型首次在指令遵循能力上反超了多步模型。

用学习替代统计,让矩匹配可扩展

扩散模型的核心困难之一,是训练好的模型在推理时需要多步迭代才能生成高质量结果。近年来,分布匹配(如Fréchet Distance损失)被用于训练后微调,希望让模型一步生成也能达到多步质量。但FD损失需要显式计算特征分布的均值和协方差矩阵,当特征维度高时,计算和存储成本急剧上升,且梯度估计不稳定。

AMFD的思路是放弃精确统计矩,改用神经网络来动态学习矩。具体来说,AMFD将扩散去噪器通过多项式投影重新表达,建立了矩摊销的通用框架。论文证明,n次投影可以显式识别到n+1阶的数据矩。从可处理的仿射情况出发,AMFD设计了一个交替优化流程,不需要显式构建协方差矩阵,就能在全局特征上学习分布差异。

这种做法带来了两个直接好处:一是训练动态更稳定,论文在FDr⁶指标上观察到AMFD显著优于FD基线;二是能自然扩展到高维特征空间,不会因为维度增加而出现计算瓶颈。

图:AMFD的方法框架与训练流程。

ImageNet单步生成同样领先

在ImageNet 256×256和512×512上,AMFD在单步生成设置下同样取得了领先结果。与FD基线相比,采用AMFD训练后,FID和FDr⁶指标均有明显改善。论文还展示了AMFD不仅适用于单步生成,在两步、四步等少步设置下也保持优势。

关键发现之一是,AMFD的矩匹配效果高度依赖特征空间的语义强度。在浅层或低语义特征上,矩匹配几乎无法区分目标分布;只有作用于具有强语义的全局表示特征时,AMFD才能有效识别和迁移分布特性。这一发现为理解扩散模型内部表示提供了新的视角。

图:多种生成方法的图像样例对比。

原生生成空间中的直接探索

AMFD的另一个独特能力是可以在原生生成空间内直接进行探索和插值。由于矩匹配是在特征层面进行的,训练完成后,模型可以在隐空间内沿矩差异方向进行移动,从而观察生成结果的连续变化。论文展示了这种"原生空间探索"的效果,生成的序列在语义上平滑过渡,表明AMFD学习的矩信息确实捕捉到了有意义的分布结构。

这一能力在传统的多步扩散模型中并不容易实现,因为多步采样的随机性会掩盖方向性移动的效果。

图:AMFD单步文生图的代表性输出样例。

文本到图像:从超越教师到可落地

AMFD最引人关注的结果来自文本到图像生成。使用FLUX.2 [klein] 4B作为教师模型,AMFD训练的单步模型在GenEval基准上达到0.846,教师模型为0.794。这意味着在指令遵循能力上,单步模型已经不需要依赖多步推理。

但需要注意两点。第一,PickScore上AMFD的单步模型与教师模型持平,说明在视觉质量偏好上尚未超越。第二,GenEval测试的是指令遵循,不代表在所有维度上都优于多步模型。单步生成在多样性和复杂场景构图上的表现还需要更多评估。

AMFD已在GitHub上开源,代码和检查点均可获取。

图:不同生成模型在隐空间探索中的样例对比。

从单步到高效部署

AMFD为单步扩散模型提供了新的训练范式。它的核心价值不在于提出新的生成架构,而在于让现有架构的单步推理达到了实用水平。对于需要低延迟图像生成的应用场景——如实时图像编辑、交互式AI设计工具——单步生成意味着推理成本大幅降低,部署门槛也随之下降。

下一步,将AMFD扩展到视频生成、3D生成等更复杂的视觉任务,是自然的方向。论文也指出,矩匹配理论框架本身可以推广到其他生成范式中。

参考资料

https://arxiv.org/abs/2607.26860

https://github.com/poppuppy/amfd