MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations
MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏
机构 * KAIST(韩国科学技术院) ; Sony Group Corporation(索尼集团公司)
AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。
Comments EMNLP 2026 Main Conference