Revisiting Vision-Language Features Adaptation and Inconsistency for Social Media Popularity Prediction
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)
Comments Submission of the 7th Social Media Prediction Challenge
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)
Comments Submission of the 7th Social Media Prediction Challenge
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Dataset and models are available at https://github.com/jihaonew/MM-Instruct
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project Website: https://invictus717.github.io/MiCo/
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to CVPRW 2024 on 'What is Next in Multimodal Foundation Models?'. Code: https://github.com/ytaek-oh/vl_compo
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICML 2024
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project: https://github.com/YangLing0818/EditWorld
专题命中 VLM训练与架构 :InternVL(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by ICML 2024. The code and checkpoints will be released at https://github.com/zehanwang01/FreeBind
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2024 Spotlight. 23 pages, 13 figures. Code at https://github.com/ziqipang/LM4VisualEncoding
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 17 pages, 9 figures
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 17 pages, 4 figures, 9 tables, 2 appendices
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CV/ML
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments added the investigation of Gemini. 66 pages, 41 figures
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 26 pages
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 23 pages, 16 figures
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted for publication at NeurIPS 2023
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Paper accepted at ICCV-W 2023. V2 contains additional comparisons with concurrent works
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments PhD Thesis, 152 pages, 32 figures, 6 tables
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by ICCV 2021
专题命中 VLM训练与架构 :LLaVA(abstract,comments);分类 cs.CV、cs.AI
Comments The source code and trained weights are available at https://github.com/visresearch/LLaVA-STF
MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。