VideoSAVi: Self-Aligned Video Language Models without Human Supervision
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV
Comments COLM 2025
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
机构 * Arizona State University(亚利桑那州立大学)
专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV
Comments COLM 2025
机构 * Fudan University(复旦大学) ; Westlake University, Tencent PCG(西湖大学、腾讯PCG)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
Comments Accepted by ACMM'MM 2025
机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; International School of Information Science and Engineering, Dalian University of Technology(大连理工大学信息科学与工程国际学院) ; Advanced Micro Devices(先进微器件公司) ; School of Science, Edith Cowan University(埃迪斯科文大学科学学院)
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
Comments Accepted by ICCV2025 (Poster)
专题命中 视频理解 :video understanding(abstract)
Comments This work was intended as a replacement of arXiv:2410.09103 and any subsequent updates will appear there
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 视频理解 :video understanding(abstract)
Comments 17 pages; Previously this version appeared as arXiv:2505.23870 which was submitted as a new work by accident