CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments 14 pages, 5 figures, 24 tables
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments 14 pages, 5 figures, 24 tables
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments ECCV 2024
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 15 pages, 2 figures, accepted by BMVC'24
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments 10 pages, 6 figures
Journal ref Proceedings of the 31st ACM International Conference on Multimedia. 2023: 4768-4777
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 15 pages
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Camera ready, CVPR 2024 (highlight). LLaVA project page: https://llava-vl.github.io
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICLR 2024 Spotlight. 23 pages, 13 figures. Code at https://github.com/ziqipang/LM4VisualEncoding
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 21 pages, 8 figures; ICLR 2024 (poster)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Accepted by AAAI 2024
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NeurIPS 2023 Main track
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ICCV 2023. Code: https://github.com/KevinLight831/CTP
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract)
Comments 6 pages, 3 figures, accepted to SIRIP 2023
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NAACL Findings 2022
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at EACL 2023 (main track); 26 pages, 21 figures, 6 tables; Pau Rodriguez and Saba Ahmadi had equal contributions
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by AAAI 2023, 12 pages, 6 figures
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ACM MM22
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Best Demo Award at CVPR 2022
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted to IJCAI2022, data and codes are available at https://github.com/CCIIPLab/DPT
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by CVPR 2022
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACL2021 main conference
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Appearing at IJCAI 2020
Mull-Tokens: 通用模态的潜在思考
机构 * Google(谷歌) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Boston University(波士顿大学)
专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Mull-Tokens,一种无需模态切换的潜在令牌,用于空间、时间等多模态推理,通过预训练和微调在四个挑战性基准上实现3%-16%的提升。
Comments Project webpage: https://arijitray.com/multimodal_thinking/, Accepted to CVPR 2026 (Findings Track)
机构 * VLM Safety LAB, MODULABS(视觉语言模型安全实验室,MODULABS) ; ETRI(电子技术研究院) ; KAIST(韩国科学技术院)
专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted to Safe and Trustworthy Multimodal AI Systems(SafeMM-AI) Workshop at ICCV2025, Non-archival track