Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos
并非所有模态都平等:面向多模态视频的指令感知门控
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) ; Tianjin University(天津大学) ; Chongqing University(重庆大学) ; Linköping University(林奈大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 提出UniMVU框架,通过内模态和模态级指令感知动态门控实现多模态视频理解,在六个基准上优于静态融合方法。
Comments 19 pages, 8 figures, 7 tables, preprint