CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024 Spolight)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Journal ref CVPR 2025
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICML 2024
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted at EMNLP 2024 Main Track
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments IEEE Transactions on Circuits and Systems for Video Technology
Journal ref IEEE Transactions on Circuits and Systems for Video Technology, 2024
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted to the main EMNLP 2024 conference
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by ACMMM 24
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 5 figures
专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 19 pages, 14 figures. Code and data are available at https://github.com/qiujihao19/Artemis
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2024. This is not the camera-ready version. The Project page: http://www.lotvsmmau.net
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted by TCSVT (IEEE Transactions on Circuits and Systems for Video Technology)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.MM
Comments EMNLP 2023
Journal ref The 2023 Conference on Empirical Methods in Natural Language Processing
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Published at NeurIPS 2023
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments 9 pages, 10 figures
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments This paper has been accepted by SCIENCE CHINA Information Sciences
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL
Comments 24th Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments ACM CSUR (December 2022). Project Link: https://bit.ly/3Oimc7Q
Journal ref ACM Comput. Surv. (December 2022)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted by IEEE T-PAMI'23
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Working in progress
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 10 pages, 7 figures
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments 15 pages, 10 figures, 7 tables, Findings at ACL 2021
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI