arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

900条样本、单卡不到2小时,2B视频模型反超大四倍对手

作者:arXivDaily编辑部 arXiv 2609.16255 cs · cs.AI · cs.CV · cs.LG

论文导读

Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校提出一套低成本视频推理蒸馏方案。团队只选约900条模型最犹豫的样本,用4B教师补充合成推理,在单张A100上训练不到两小时。得到的2B模型在三个视频问答基准上超过最高大四倍的对比模型,并接近自己的4B教师。

不从容易题开始,专挑模型最犹豫的900条

视频问答数据量很大,但许多样本对已有模型过于简单,继续训练带来的信息有限。研究先让2B模型回答候选问题,观察最可能的两个词之间概率差距。差距越小,说明模型越拿不准,样本越值得用于微调。

团队从数据中选出约900条高不确定样本,只占候选池的一小部分。4B教师为每条样本生成简短推理,再把问题、答案和推理组合成训练数据。这个过程把算力集中在模型当前不会的内容上。

论文Figure 1:2B模型先筛出约900条高不确定样本,4B教师再生成合成推理用于微调。

反常识的一步:先给答案,再写推理

常见思维链格式要求模型先写推理过程,最后给答案。论文发现,对容量较小的视频模型,把答案放在前面、推理放在后面效果更好。训练时,模型先学习短而明确的目标,再把教师解释作为补充信号。

作者认为,小模型在生成长推理时更容易累积错误;先锁定答案能减少格式和推理长度带来的负担。这里的推理仍是教师合成文本,不等于模型内部过程被完整还原,它的作用是提供更细的监督线索。

论文Figure 2:按模型难度筛选并加入合成推理时,少量样本带来的平均准确率提升最快。

单卡不到两小时,跨三个基准测试

训练使用单张A100,不到两小时。2B模型在CinePile、ActivityNet-QA和MLVU上测试,论文报告它超过最高大四倍的若干视频语言模型,并接近生成训练解释的4B教师。跨数据集测试比只看训练来源更能说明方法没有完全记住900道题。

论文PDF结果区域:不同规模视频语言模型与蒸馏设置在视频问答基准上的对比。

“超过大四倍模型”限定于论文列出的模型、任务和指标,不代表2B模型在开放视频理解上全面更强。训练成本也没有包含教师生成推理、预训练模型和数据准备的全部开销。

小模型训练下一步转向“挑题”与“短监督”

这套方案适合算力有限、需要在端侧或私有环境部署视频模型的团队。下一步需要测试更长视频、更多开放问答,以及教师解释错误时小模型会不会被带偏。如果难样本筛选能在线更新,训练流程就可以反复找出模型当前最薄弱的部分,而不是每次重新堆一大批数据。

部署评估还应补充延迟、显存与真实业务分布下的稳定性。

参考资料

https://arxiv.org/abs/2609.16255

https://arxiv.org/pdf/2609.16255