arXivDaily arXiv每日学术速递 周一至周五更新

作者

Yann LeCun

Deep Learning / Vision

2026-01-23 至 2026-01-23 共收录 1
2601.16208 2026-01-23 cs.CV

Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

通过表征自编码器扩展文本到图像扩散变换器

Shengbang Tong, Boyang Zheng, Ziteng Wang, Bingda Tang, Nanye Ma, Ellis Brown, Jihan Yang, Rob Fergus, Yann LeCun, Saining Xie

机构 * New York University(纽约大学)

AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。

Comments website: https://rae-dit.github.io/scale-rae/

详情

展开后加载摘要…

URL PDF HTML 收藏