Reasoning-Aware Multimodal Fusion for Hateful Video Detection
面向仇恨视频检测的推理感知多模态融合
机构 * Multimodal Intelligence Lab(多模态智能实验室) ; Department of Computer Science(计算机科学系) ; University of Exeter(埃克塞特大学) ; School of Computer Science(计算机科学学院) ; University of Leeds(利兹大学) ; School of Computer Science and Informatics(计算机科学与信息学学院) ; University of Liverpool(利物浦大学) ; University of Birmingham(伯明翰大学) ; Machine Intelligence + x Group(机器智能+X小组)
AI总结 提出推理感知多模态融合框架,通过局部-全局上下文融合和语义交叉注意力实现多模态交互,并引入对抗推理生成互补语义视角,在仇恨视频检测中提升Macro-F1和召回率3%和7%。
Comments Accepted at Transactions on Machine Learning Research (TMLR)