XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition
XOV-Action:迈向可泛化的开放词汇动作识别
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Institute of Big Data, Fudan University(复旦大学大数据研究院) ; AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。
Comments Accepted by TPAMI