LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
LightFusion: 一种轻量级、双融合框架用于统一多模态理解和生成
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Tsinghua University(清华大学) ; Monash University(墨尔本大学) ; ByteDance Seed Project(字节跳动种子项目)
专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 LightFusion通过双融合机制实现轻量级多模态理解和生成,仅用350亿个标记训练即在多个基准测试中取得优异成绩。
Comments Preprint. Work in progress