Surgical-MambaLLM: Mamba2-enhanced Multimodal Large Language Model for VQLA in Robotic Surgery
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Imperial College London(帝国理工学院伦敦分校) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
Comments Early accepted by MICCAI2025