Small-Large Collaboration: Training-efficient Concept Personalization for Large VLM using a Meta Personalized Small VLM
机构 * Peking University(北京大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Peking University(北京大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; USTC(中国科学技术大学) ; RIT(罗切斯特理工学院) ; HIT(哈尔滨工业大学) ; WHU(武汉大学) ; MBZUAI(马克斯·普朗克人工智能研究所) ; NUS(新加坡国立大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI
Comments 35 pages, 33 figures
机构 * Texas A&M University(德克萨斯A&M大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 19 pages, 5 figures, Preprint under review. Code available at: https://github.com/taco-group/DRAMA-X
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted by ICCV2025
机构 * New York University(纽约大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)
Comments 4 pages, 1 figure, ACM UIST 2025 Poster
机构 * Socially Intelligent Robotics Lab, Institute for Artificial Intelligence, University of Stuttgart(社会智能机器人实验室,人工智能研究所,斯图加特大学) ; Robot Perception and Learning Lab, LAMARR Institute for Machine Learning and Artificial Intelligence, University of Bonn(机器人感知与学习实验室,LAMARR机器学习与人工智能研究所,波恩大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments Paper accepted for IROS 2025
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * Honor AI Center(荣耀人工智能中心) ; Zhejiang University(浙江大学) ; Bytedance(字节跳动) ; Ningbo Tech University(宁波科技学院)
专题命中 视觉推理 :vision language model(abstract);分类 cs.CV
Comments 11 pages, 5 figures