OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
机构 * Microsoft Research Asia(微软亚洲研究院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
Comments Accepted to ACL 2025 Main Conference
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
机构 * Microsoft Research Asia(微软亚洲研究院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
Comments Accepted to ACL 2025 Main Conference
机构 * German Research Center for Artificial Intelligence (DFKI), Cognitive Assistants Lab, Saarland Informatics Campus(德国人工智能研究中心(DFKI)、认知助理实验室、萨尔兰州信息技术校区) ; Fédération ENAC ISAE-SUPAERO ONERA, Université de Toulouse(ENAC ISAE-SUPAERO ONERA联合会、图卢兹大学)
专题命中 融合架构与评测 :multi-modal fusion(abstract)