论文导读
Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校提出一套低成本视频推理蒸馏方案。团队只选约900条模型最犹豫的样本,用4B教师补充合成推理,在单张A100上训练不到两小时。得到的2B模型在三个视频问答基准上超过最高大四倍的对比模型,并接近自己的4B教师。
不从容易题开始,专挑模型最犹豫的900条
视频问答数据量很大,但许多样本对已有模型过于简单,继续训练带来的信息有限。研究先让2B模型回答候选问题,观察最可能的两个词之间概率差距。差距越小,说明模型越拿不准,样本越值得用于微调。
团队从数据中选出约900条高不确定样本,只占候选池的一小部分。4B教师为每条样本生成简短推理,再把问题、答案和推理组合成训练数据。这个过程把算力集中在模型当前不会的内容上。
论文Figure 1:2B模型先筛出约900条高不确定样本,4B教师再生成合成推理用于微调。
反常识的一步:先给答案,再写推理
常见思维链格式要求模型先写推理过程,最后给答案。论文发现,对容量较小的视频模型,把答案放在前面、推理放在后面效果更好。训练时,模型先学习短而明确的目标,再把教师解释作为补充信号。
作者认为,小模型在生成长推理时更容易累积错误;先锁定答案能减少格式和推理长度带来的负担。这里的推理仍是教师合成文本,不等于模型内部过程被完整还原,它的作用是提供更细的监督线索。
论文Figure 2:按模型难度筛选并加入合成推理时,少量样本带来的平均准确率提升最快。
单卡不到两小时,跨三个基准测试
训练使用单张A100,不到两小时。2B模型在CinePile、ActivityNet-QA和MLVU上测试,论文报告它超过最高大四倍的若干视频语言模型,并接近生成训练解释的4B教师。跨数据集测试比只看训练来源更能说明方法没有完全记住900道题。
论文PDF结果区域:不同规模视频语言模型与蒸馏设置在视频问答基准上的对比。
“超过大四倍模型”限定于论文列出的模型、任务和指标,不代表2B模型在开放视频理解上全面更强。训练成本也没有包含教师生成推理、预训练模型和数据准备的全部开销。
小模型训练下一步转向“挑题”与“短监督”
这套方案适合算力有限、需要在端侧或私有环境部署视频模型的团队。下一步需要测试更长视频、更多开放问答,以及教师解释错误时小模型会不会被带偏。如果难样本筛选能在线更新,训练流程就可以反复找出模型当前最薄弱的部分,而不是每次重新堆一大批数据。
部署评估还应补充延迟、显存与真实业务分布下的稳定性。