Cross-Modal Dual-Causal Learning for Long-Term Action Recognition
机构 * Beijing University of Technology(北京理工大学) ; Chinese Academy of Sciences(中国科学院) ; Capital Medical University(首都医科大学)
专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Beijing University of Technology(北京理工大学) ; Chinese Academy of Sciences(中国科学院) ; Capital Medical University(首都医科大学)
专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(title,abstract)
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) ; Center for Vision Technology, SRI International(视觉技术中心,SRI国际)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICCV 2025 main conference
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; BUPT(北京邮电大学) ; ByteDance(字节跳动)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Project page: https://llava-vl.github.io/blog/2024-09-30-llava-video/; Accepted at TMLR