arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Qualcomm(高通)

2026-07-21 至 2026-07-21 共收录 1
2607.14711 2026-07-21 cs.CV cs.AI 版本更新

VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

VideoSEMA:用于视频理解的一种可扩展且高效的类曼巴注意力机制

Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Qualcomm AI Research(高通人工智能研究中心) Qualcomm Technologies, Inc.(高通技术公司)

AI总结 研究针对视频理解提出VideoSEMA模型,核心方法是采用时空注意力分割,包含空间类曼巴注意力模块和时间注意力。主要贡献是在多数据集上表现优异,参数规模相当时准确率领先,分辨率提升时退化更平缓,扩展到长视频也有前景。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏