Cross-Modal Attention Guided Unlearning in Vision-Language Models
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Bilibili Inc.(哔哩哔哩公司)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * University of Southern California(美国南加州大学) ; Emory University(埃默里大学)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; TU Munich(慕尼黑技术大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 63 pages, 29 tables, and 47 figures
机构 * Nanjing University(南京大学) ; ByteDance(字节跳动) ; Nankai University(南开大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 视觉问答 :multimodal large language model(abstract)
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute for AI(人工智能矢量研究所)
专题命中 视觉推理 :vision-language model(title);vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Preprint. Project page: https://davidhalladay.github.io/diysink_demo
机构 * Intelligent Creation Team, ByteDance(字节跳动智能创作团队)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Project Page: https://zju-real.github.io/SpatialLadder/ Code: https://github.com/ZJU-REAL/SpatialLadder
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Columbia University(哥伦比亚大学) ; University of Maryland(马里兰大学) ; University of Southern California(南加州大学) ; New York University(纽约大学)
专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG
Comments dataset link: https://huggingface.co/datasets/multimodal-reasoning-lab/Zebra-CoT
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学) ; Dexmal
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Project Page: https://yunfeixie233.github.io/ViGaL/
机构 * University of Central Florida(中央佛罗里达大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Stanford University(斯坦福大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Jiaotong University(上海交通大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; East China Normal University(华东师范大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
Comments 25pages,20figures
机构 * Beijing Institute of Technology(北京理工大学) ; Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI
机构 * The Ohio State University(俄亥俄州立大学) ; Bosch Research North America(博世北美研究)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Show Lab, National University of Singapore(展示实验室,新加坡国立大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
Comments Project Page: https://showlab.github.io/Paper2Video/
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted to PMLR 298, 10th Machine Learning for Healthcare Conference (MLHC)
机构 * MIT McGovern Institute for Brain Research(麻省理工学院麦戈文脑研究所) ; University of Cincinnati College of Medicine(辛辛那提大学医学院)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :grounding(abstract)
Comments 34 pages, 11 figures
机构 * Utrecht University(乌特雷赫大学) ; Stichting Reclame Code(Reclame Code基金会) ; Maastricht University(马斯特里赫特大学)
专题命中 视觉定位与Grounding :grounding(abstract)
Comments Accepted for publication at the Natural Legal Language Processing Workshop (NLLP) 2025, co-located with EMNLP
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉定位与Grounding :grounding(abstract)
机构 * Kyushu University(九州大学) ; CyberAgent
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; Xiamen Huaxia University(厦门华夏大学) ; Fuzhou University(福州市大学) ; City University of Hong Kong(香港城市大学) ; Huawei Cloud BU(华为云业务单元)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI
机构 * West China Biomedical Big Data Center, West China Hospital, SCU(西昌生物医学大数据中心、西昌医院、SCU) ; NTU ; USTC ; TeleAI, China Telecom(TeleAI、中国电信) ; BUPT ; Tsinghua University(清华大学) ; HKUST(Guangzhou)(HKUST(广州))
专题命中 幻觉与鲁棒性 :VLM(title,abstract);分类 cs.CV、cs.LG
机构 * University of Rochester(罗切斯特大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);visual question answering(abstract);分类 cs.AI
Comments Accepted to EMNLP Findings
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI
机构 * School of Artificial Intelligence, Henan University of Technology(河南工业大学人工智能学院) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI