VideoSEMA: a scalable and efficient Mamba-like attention for video understanding
VideoSEMA:用于视频理解的一种可扩展且高效的类曼巴注意力机制
机构 * University of California, Irvine(加利福尼亚大学欧文分校) ; Qualcomm AI Research(高通人工智能研究中心) ; Qualcomm Technologies, Inc.(高通技术公司)
AI总结 研究针对视频理解提出VideoSEMA模型,核心方法是采用时空注意力分割,包含空间类曼巴注意力模块和时间注意力。主要贡献是在多数据集上表现优异,参数规模相当时准确率领先,分辨率提升时退化更平缓,扩展到长视频也有前景。
Comments 15 pages, 3 figures