arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

美团清华训练150多个VLM,选视觉底座可以提前算

arXiv 2608.00013 cs.AI · cs.CL · cs.CV

美团与清华大学团队训练了150多个视觉语言模型,覆盖34个大语言模型和7个模型家族,尝试在多模态训练开始前预测哪一个LLM更适合做视觉底座。

团队发现,单看参数量或训练计算量,跨模型家族的预测很不稳定;把LLM在文本任务中表现出的能力压缩成一个分数,反而能更好预测后续多模态准确率和训练轨迹。

计算量缩放规律与能力缩放规律的对比

论文图1:同一模型家族内参数量可以拟合趋势,跨家族时文本能力分数更稳定。

先测文本能力,再估计视觉训练曲线

新方法从多项文本基准中提取低维能力分数,再为每个底座估计两个量:文本能力迁移到多模态任务的速度,以及增加图文数据后吸收信息的效率。

它不需要先把所有候选底座完整训练成VLM。研究人员可以使用已有文本评测,加上少量受控训练点,估算更大数据规模下的表现,减少对几十种底座逐一试训的成本。

32个LLM底座对应的多模态训练曲线

论文图2:模型同时拟合不同底座在多个训练检查点上的多模态准确率。

从8B外推到72B,也能跨过未见家族

论文用200多个文本基准和50多个多模态基准检查规律。只用最高8B参数的模型拟合后,公式仍能预测72B底座的迁移率;把某个模型家族完全留出,预测结果也保持较高一致性。

缩放公式在未见模型家族上的预测

论文图4:研究把整个模型家族留作测试,比较预测曲线与实际训练结果。

这些结果来自严格统一的训练配方。数据、视觉编码器、连接模块和训练策略都被控制,便于研究底座差异。实际项目如果同时更换数据质量、对齐方式或模型结构,公式需要重新校准。

文本榜单高分有时反而是负信号

逐项分析出现了一个反常识结果:部分文本基准分数与多模态表现负相关。作者认为,这可能暴露模型对特定榜单的过度适配;会做某类文本题,不代表知识能顺利迁移到图像理解。

文本基准与多模态得分的相关关系

论文图6:17个模型的文本分数与VLM分数整体相关,但不同基准的相关方向并不一致。

同一家族中,基础版LLM作为视觉底座经常优于指令微调版。实验给出的解释是基础模型吸收多模态数据更快,数据规模扩大后的衰减更低。这一结论针对论文所用训练流程,不能直接写成基础模型在所有多模态任务上全面优于指令模型。

这套规律把底座选择变成可量化的预估问题,但仍需要真实训练点和统一评测。它适合缩小候选范围,无法替代最终模型在目标业务数据上的验证。

参考资料

https://arxiv.org/abs/2608.00013