2608.16887
2026-08-18
cs.CV
新提交
87%
An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models
像素空间文本到图像扩散模型训练的实证研究
Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi
机构
*
Alibaba Token Hub(阿里巴巴令牌中心)
;
Alibaba Group(阿里巴巴集团)
;
Nanjing University(南京大学)
;
University of California San Diego(加利福尼亚大学圣迭戈分校)
专题命中
扩散模型
:diffusion(title,abstract);text-to-image(title);分类 cs.CV
AI总结
本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。