VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos
机构 * Xidian University(西电大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Xidian University(西电大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学自然与人工智能研究所) ; Department of Computer Science, Harvard University(哈佛大学计算机科学系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments COLM 2025
机构 * National Taiwan University(国立台湾大学) ; The University of Tokyo(东京大学) ; Reichman University(里奇曼大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
Comments 11 pages, Hsiao-Yuan Chin and I-Chao Shen contributed equally to the paper
机构 * Shanghai University(上海大学) ; Beijing University of Chemical Technology(北京化工大学) ; University of Minnesota(明尼苏达大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
Comments Accepted by ICCV 2025
机构 * Mizzen AI ; CUHK MMLab(香港大学MMLab) ; King’s College London(伦敦国王学院) ; Shanghai Jiaotong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CPII, InnoHK(创新香港科技促进会)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
Comments ICCV2025