UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer
UniDDT: 使用解耦扩散变换器统一多模态理解与生成
机构 * Nanjing University(南京大学) ; ByteDance Seed(字节跳动Seed) ; University of Hong Kong(香港大学)
AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。
Comments This work was completed in \textbf{November 2025}