Projector Is All You Train
仅训练投影器就足够
机构 * Ramen VR(拉面VR公司) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究探究多模态大语言模型适配新模态是否需微调主干,经实验发现仅训练投影器即可实现强多模态性能,还能避免联合训练导致的语言模型能力漂移,且训练样本吞吐量约为联合训练的两倍,通过多类基准验证了结论。