Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs
知识即力量:利用大语言模型的多模态语义提升少样本动作识别
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出FSAR-LLaVA,首次利用大语言模型作为多模态知识库直接增强少样本动作识别。通过多模态解码器提取时空丰富表示,结合多模态特征增强模块生成视觉和文本特征,并利用MLLM的灵活性设计复合任务导向原型构造,提升跨数据集性能。