Preserve and Sculpt: Manifold-Aligned Fine-tuning of Vision-Language Models for Few-Shot Learning
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV
Comments Accepted by ICIP 2025 Conference
机构 * VRG, FEE, Czech Technical University in Prague(捷克布拉格技术大学)
专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV
Comments ICCVW 2025 accepted paper. Workshop name: "What is Next in Multimodal Foundation Models?"
机构 * College of Engineering, Purdue University(普渡大学工程学院)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract)
机构 * Alibaba Group(阿里巴巴集团)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) ; School of Automation, Central South University(自动化学院,中南大学) ; School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 10 pages, 3 figures, submitted to ACM Multimedia 2025
机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Applied Artificial Intelligence Institute, Deakin University, Australia(应用人工智能研究所,德金大学,澳大利亚)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
Comments Accepted for publication at ECAI 2025