VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
VLM-AutoDrive: 事后训练视觉-语言模型用于安全关键的自动驾驶事件
机构 * NVIDIA
专题命中 视觉问答 :VLM(title,title_cn);vision-language model(title,abstract);visual question answering(abstract);multimodal large language model(abstract)
AI总结 本文提出VLM-AutoDrive框架,通过整合元数据生成的描述、LLM生成的描述、视觉问答对和推理监督,提升预训练视觉语言模型在安全关键自动驾驶事件中的检测性能。
Comments 16 pages, 9 figures, submitted to arXiv