Leveraging Multimodal LLM Descriptions of Activity for Explainable Semi-Supervised Video Anomaly Detection
利用多模态大语言模型对活动的描述进行可解释的半监督视频异常检测
机构 * Department of Electrical Engineering University of South Florida(电气工程系 佛罗里达州立大学) ; Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出利用多模态大语言模型描述活动,以实现可解释的半监督视频异常检测,有效检测复杂交互异常并提升模型可解释性。