MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding
MMViR:一种多模态和多粒度表示用于长视频理解
机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校信息融合实验室) ; ALOHA Lab, University of Hawaii at Mānoa(夏威夷大学马诺阿分校ALOHA实验室)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 MMViR通过多模态和多粒度表示提升长视频理解,实现更高效的检索和更优的性能表现。
Comments 13 pages, 11 figures