Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
机构 * HKUST(香港科技大学) ; NTU(国立台湾大学) ; SYSU(南方科技大学) ; NUS(国立新加坡大学) ; Alibaba Group(阿里巴巴集团)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
Comments Project Page: https://livioni.github.io/OmniVGGT-official/