Vision Foundation Models as Generalist Tokenizers for Image Generation
视见过滤模型作为图像生成的通用标记器
机构 * University of Hong Kong(香港大学) ; StepFun
AI总结 本文提出了一种基于冻结视见过滤模型(VFM)的通用图像标记器VFMTok,通过区域自适应量化框架和语义重建目标,提升了图像生成的质量和效率,同时在离散和连续潜在空间中实现了高保真度的类别条件合成。
Comments 4 figures and 14 tables