CARScenes: Semantic VLM Dataset for Safe Autonomous Driving
机构 * st Yuankai He(第一作者) ; nd Weisong Shi(第二作者)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV
Comments 8 pages, 6 figures, 7 tables
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * st Yuankai He(第一作者) ; nd Weisong Shi(第二作者)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV
Comments 8 pages, 6 figures, 7 tables
机构 * AI VIETNAM(AI越南) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; PTIT ; Northwestern University(西北大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Acccepted in MICCAI Workshop 2025
机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) ; Apple(苹果公司)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * AIR, Tsinghua University(空气动力学研究所,清华大学) ; King’s College London(伦敦国王学院) ; The University of Manchester(曼彻斯特大学) ; The University of Hong Kong(香港大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 25 pages, 7 figures, 5 tables
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments EMNLP 2025 main