VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding
VideoBrain: 学习自适应帧采样以理解长视频
机构 * Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出VideoBrain框架,通过CLIP和均匀采样双智能体策略,使视觉语言模型自适应获取关键帧,在减少30-40%帧数的同时提升长视频理解准确率3.5%-9.0%。