The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge
机构 * East China Normal University(东华师范大学)
专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * East China Normal University(东华师范大学)
专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :InternVL(abstract);multimodal large language model(abstract)
Comments Accepted by EMNLP 2025
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)
Comments Accepted to Color and Imaging Conference (CIC) 2025
机构 * X SQUARE ROBOT
专题命中 VLM训练与架构 :vision-language model(abstract)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract)
机构 * Google(谷歌)
专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI
Comments 15 pages, 7 figures, 2 tables (22 pages, 9 figures and 3 tables including references and appendices)
专题命中 其他VLM :vision-language model(abstract)
专题命中 其他VLM :multimodal large language model(abstract)
Comments 35 pages, 5 figures