Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
学习紧凑的视频表示以在大规模多模态模型中实现高效的长视频理解
机构 * Amazon AGI(亚马逊人工智能研究院)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出了一种端到端的长视频理解框架,结合自适应视频采样器和空间时间视频压缩器,以高效处理长视频的冗余问题。