Cross-Modal Attention Guided Unlearning in Vision-Language Models
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Bilibili Inc.(哔哩哔哩公司)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * University of Southern California(美国南加州大学) ; Emory University(埃默里大学)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; TU Munich(慕尼黑技术大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 63 pages, 29 tables, and 47 figures
机构 * Nanjing University(南京大学) ; ByteDance(字节跳动) ; Nankai University(南开大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 视觉问答 :multimodal large language model(abstract)