Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models
Delta-LLaVA: 基于令牌效率的视觉-语言模型对齐方法
机构 * University of Wyoming(怀俄明大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(title);multimodal large language model(abstract);分类 cs.CV
AI总结 Delta-LLaVA通过低秩Delta投影和轻量级Transformer块实现视觉-语言模型的高效对齐,提升推理速度和训练效率。