GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models
GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型
机构 * Univ City(大学城市)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。
Journal ref Communications in Transportation Research 4 (2024) 100116