What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs
从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态
机构 * Meituan(美团) ; Tsinghua University(清华大学)
AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。