MMDrive: Interactive Scene Understanding Beyond Vision with Multi-representational Fusion
MMDrive: 通过多表示融合超越视觉的交互场景理解
机构 * organization= College of Computer Science ; Technology, Jilin University , city= Changchun , country= China ; organization= Georgia Institute of Technology , city= Atlanta , country= USA ; organization= Qingdao Institute of Software, College of Computer Science ; Technology, China University of Petroleum (East China) , city= Qingdao , country= China ; organization= Institute for Math \& AI, Wuhan University , city= Wuhan , country= China ; organization= University of Michigan, Ann Arbor , country= USA ; organization= Thrust of Artificial Intelligence, Hong Kong University of Science ; organization= School of Artificial Intelligence ; Computer Science, Nantong University , city= Nantong , country= China
专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO
AI总结 MMDrive通过融合占用图、LiDAR点云和文本描述,实现超越视觉的三维场景理解,提升自动驾驶的多模态推理能力。