ActAlign: Zero-Shot Fine-Grained Video Classification via Language-Guided Sequence Alignment
机构 * Department of Computer Science, Temple University(Temple大学计算机科学系) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM
Comments Accepted to TMLR 2025 - Project page: https://amir-aghdam.github.io/act-align/