Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
Journal ref Multimedia Systems 31, 105 (2025)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
Journal ref Multimedia Systems 31, 105 (2025)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments CVPR 2024 (Updated version with corrections for typos and errors.)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
Comments ICLR 2025 (spotlight)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
Comments Accepted to TPAMI. Code is available at https://github.com/zhoudw-zdw/PROOF
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
Comments Accepted by USENIX'25; 22 pages, 28 figures;
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Journal ref Nature Machine Intelligence (2025)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 8 pages, 2 figures
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
Comments TPAMI 2025; 17 pages, 13 figures, 11 tables; Code at this https URL: https://github.com/Daniel-xsy/RoboBEV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Preprint version
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments ICLR 2025. Code is available at github.com/martian422/ClawMachine
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments in progress
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments 10 pages
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments accepted to IEEE TIP
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
Comments Updated version of the paper presented in 2025 AIAA SciTech. https://arc.aiaa.org/doi/10.2514/6.2025-1543
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
Comments 74 pages (18 pages manuscript, 7 pages references, 49 pages appendix)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted for publication at aaai25, project page: https://jasonjin34.github.io/logicad.github.io/
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.AI