Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
通过表征自编码器扩展文本到图像扩散变换器
机构 * New York University(纽约大学)
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。
Comments website: https://rae-dit.github.io/scale-rae/