SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
Zheng Liu, Hao Liang, Bozhou Li, Wentao Xiong, Chong Chen, Conghui He, Wentao Zhang, Bin Cui
机构
*
Peking University Beijing China
;
Huawei Technologies Ltd. Beijing China
;
Shanghai AI Laboratory Shanghai China
;
Peking University Center for Machine Learning Research Beijing China
;
Peking University School of Computer Science \& Key Lab of High Confidence Software Technologies (MOE) Beijing China
;
Peking University
;
Huawei Technologies Ltd.
;
Shanghai AI Laboratory