SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
机构 * Peking University Beijing China ; Huawei Technologies Ltd. Beijing China ; Shanghai AI Laboratory Shanghai China ; Peking University Center for Machine Learning Research Beijing China ; Peking University School of Computer Science \& Key Lab of High Confidence Software Technologies (MOE) Beijing China ; Peking University ; Huawei Technologies Ltd. ; Shanghai AI Laboratory
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV