VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion
机构 * Institute for Speech and Language Processing, Athena Research Center, Greece(语音与语言处理研究所,亚特兰蒂斯研究中心,希腊)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
机构 * Institute for Speech and Language Processing, Athena Research Center, Greece(语音与语言处理研究所,亚特兰蒂斯研究中心,希腊)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
专题命中 融合架构与评测 :multi-modal fusion(title);分类 cs.MM
机构 * Xi’an Institute of Optics and Precision Mechanics, CAS(西安光学精密机械研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Southwest Jiaotong University(西南交通大学) ; Zhongnan Hospital of Wuhan University(武汉大学中南医院) ; Xi’an Jiaotong University(西安交通大学) ; National Key Laboratory of Information Systems Engineering(信息系统工程国家重点实验室)
专题命中 融合架构与评测 :information fusion(abstract)