Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
机构 * S-Lab, NTU, Singapore(新加坡国立大学S实验室) ; LMMs-Lab Team(多模态模型实验室团队) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * S-Lab, NTU, Singapore(新加坡国立大学S实验室) ; LMMs-Lab Team(多模态模型实验室团队) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
机构 * School of Software Engineering(软件工程学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy(人工智能与数字经济广东实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Korea University(韩国大学)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) ; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) ; Fanyu AI Laboratory, Zhongke Fanyu Technology Co., Ltd, Beijing, China(凡语AI实验室,中科创始人技术有限公司,北京,中国)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
Comments EMNLP2025 Main
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
Comments Accepted at AIES 2025
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.LG
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
Comments Accepted to ICCV 2025. Code available at https://github.com/adobe-research/CompCon
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
Comments Accepted by ICML 2025
机构 * Tel Aviv University(特拉维夫大学) ; Bar Ilan University(巴伊兰大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Project page https://shadyabh.github.io/ADIR/
Journal ref BMVC 2025
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Kuaishou Technology(快手科技)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
机构 * Argonne National Laboratory(阿贡国家实验室) ; Illinois Institute of Technology(伊利诺伊理工学院)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG
Comments Accepted by ICCV Bivision Workshop 2025
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
Comments The benchmark MulSeT is available at https://huggingface.co/datasets/WanyueZhang/MulSeT
机构 * University of California Santa Cruz(加州大学圣克鲁兹分校) ; Apple(苹果公司) ; University of California Berkeley(加州大学伯克利分校)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
机构 * Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
Comments 16 pages, 7 figures, held online presentation at NLPA 2025
机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) ; Peking University(北京大学) ; Salesforce Research(Salesforce 研究) ; Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments ACL 2025 Findings. Code: https://github.com/yaolinli/GenS
机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments EMNLP2025 Findings
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments 10 pages, 3 figures
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV
Comments Paper accepted at the eXCV Workshop at ECCV 2024. Supplementary material included. Code available at https://github.com/idiap/itm
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
Comments 11 pages, 5 figures
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
Comments 9 pages, 6figures
机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
Comments Homepage: https://omnihuman-lab.github.io/v1_5/
机构 * Bytedance Waver Team(字节跳动Waver团队)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
机构 * Department of Computer Science(计算机科学系) ; Hong Kong Baptist University(香港 Baptist 大学) ; NVIDIA AI Technology Center(NVIDIA AI 技术中心) ; NVIDIA
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Mizzen AI ; CUHK MMLab(香港大学MMLab) ; King’s College London(伦敦国王学院) ; Shanghai Jiaotong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CPII, InnoHK(创新香港科技促进会)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
Comments ICCV2025
机构 * Louisiana State University(路易斯安那州立大学) ; Northeastern University(东北大学) ; Yale University(耶鲁大学)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI
Comments This paper will appear in CCS 2025
机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
机构 * Leibniz University Hannover(汉诺威莱布尼茨大学) ; L3S Research Center(L3S研究中心)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Applied Artificial Intelligence Institute, Deakin University, Australia(应用人工智能研究所,德金大学,澳大利亚)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
Comments Accepted for publication at ECAI 2025
机构 * University of Freiburg(弗赖堡大学) ; deepset
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments accepted at GCPR 2025