TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
TimeViper: 一种用于高效长视频理解的混合Mamba-Transformer视觉语言模型
机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室) ; MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 TimeViper是一种混合Mamba-Transformer模型,通过TransV模块实现高效长视频理解,提升多模态处理能力。
Comments Project page: https://xuboshen.github.io/TimeViper; Code: https://github.com/xiaomi-research/timeviper