MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
Comments 19 pages, 9 figures, Published in CVPR2024
Journal ref In Proc. IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024