3VL: Using Trees to Improve Vision-Language Models' Interpretability
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments accepted to IEEE TIP
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments accepted to IEEE TIP
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
Comments Updated version of the paper presented in 2025 AIAA SciTech. https://arc.aiaa.org/doi/10.2514/6.2025-1543
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
Comments 74 pages (18 pages manuscript, 7 pages references, 49 pages appendix)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted for publication at aaai25, project page: https://jasonjin34.github.io/logicad.github.io/
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.AI
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted by T-IP. A PyTorch re-implementation is at https://github.com/VamosC/CLIP4STR (Credit on GitHub@VamosC)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
Comments update author
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Equal contribution: Chao Pang, Xingxing Weng, Jiang Wu; Corresponding author: Gui-Song Xia, Conghui He
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Accepted by AAAI 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 11 pages, 9 figures
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
Comments 17 pages. Work done during 2023 summer and has been released
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Disclaimer: This work is part of a course project and reflects ongoing exploration in the field of vision-language models and calorie estimation. Findings and conclusions are subject to further validation and refinement
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments 13 pages, 10 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments WACV 2025