美团与清华大学团队训练了150多个视觉语言模型,覆盖34个大语言模型和7个模型家族,尝试在多模态训练开始前预测哪一个LLM更适合做视觉底座。
团队发现,单看参数量或训练计算量,跨模型家族的预测很不稳定;把LLM在文本任务中表现出的能力压缩成一个分数,反而能更好预测后续多模态准确率和训练轨迹。
论文图1:同一模型家族内参数量可以拟合趋势,跨家族时文本能力分数更稳定。
先测文本能力,再估计视觉训练曲线
新方法从多项文本基准中提取低维能力分数,再为每个底座估计两个量:文本能力迁移到多模态任务的速度,以及增加图文数据后吸收信息的效率。
它不需要先把所有候选底座完整训练成VLM。研究人员可以使用已有文本评测,加上少量受控训练点,估算更大数据规模下的表现,减少对几十种底座逐一试训的成本。
论文图2:模型同时拟合不同底座在多个训练检查点上的多模态准确率。
从8B外推到72B,也能跨过未见家族
论文用200多个文本基准和50多个多模态基准检查规律。只用最高8B参数的模型拟合后,公式仍能预测72B底座的迁移率;把某个模型家族完全留出,预测结果也保持较高一致性。
论文图4:研究把整个模型家族留作测试,比较预测曲线与实际训练结果。
这些结果来自严格统一的训练配方。数据、视觉编码器、连接模块和训练策略都被控制,便于研究底座差异。实际项目如果同时更换数据质量、对齐方式或模型结构,公式需要重新校准。
文本榜单高分有时反而是负信号
逐项分析出现了一个反常识结果:部分文本基准分数与多模态表现负相关。作者认为,这可能暴露模型对特定榜单的过度适配;会做某类文本题,不代表知识能顺利迁移到图像理解。
论文图6:17个模型的文本分数与VLM分数整体相关,但不同基准的相关方向并不一致。
同一家族中,基础版LLM作为视觉底座经常优于指令微调版。实验给出的解释是基础模型吸收多模态数据更快,数据规模扩大后的衰减更低。这一结论针对论文所用训练流程,不能直接写成基础模型在所有多模态任务上全面优于指令模型。
这套规律把底座选择变成可量化的预估问题,但仍需要真实训练点和统一评测。它适合缩小候选范围,无法替代最终模型在目标业务数据上的验证。