MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments ICCV 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments ICCV 2025
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments To Appear in the 34th USENIX Security Symposium, August 2025
机构 * Auburn University(奥本大学) ; Google DeepMind, ML Collective(谷歌DeepMind及ML集体) ; Adobe Research(Adobe研究)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省级多模态认知计算重点实验室) ; School of Computer Science and Technology(计算机科学与技术学院) ; Anhui University(安徽大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * Institute of Health Informatics(健康信息学研究所)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV
机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) ; College of Future Information Technology, Fudan University(未来信息技术学院,复旦大学) ; College of Computer Science, Wuhan University(计算机科学学院,武汉大学)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Code can be found at https://github.com/FerdinandZJU/IAP
机构 * Berkeley(伯克利)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);grounding(abstract);分类 cs.CV
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北航)
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * MoE Key Lab of Artificial Intelligence, AI Institute Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学AI研究院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by ICCV2025
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Department of Pathology, West China Second University Hospital, Sichuan University(四川大学病理科西昌第二大学医院部) ; Department of Radiation Oncology, Sichuan Cancer Hospital and Institute, University of Electronic Science and Technology of China(四川癌症医院与研究所放射肿瘤科,电子科技大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments MICCAI 2025 early accept
机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) ; Vector Institute for AI(人工智能矢量研究所) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) ; School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) ; Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
Comments 15 pages, 4 figures, under review of NeurIPS
机构 * Department of Informatics, Graduate School of Informatics and Engineering, The University of Electro-Communications(信息学院、信息工程研究生院、东京电波通信大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);分类 cs.CV
Comments arXiv admin note: substantial text overlap with arXiv:2409.09306
机构 * Center of Smart Health, Hong Kong Polytechnic University, Hong Kong, China(智能健康中心,香港理工大学,中国)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments 34 pages
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究院) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI技术(无锡)有限公司) ; Technical University of Munich(慕尼黑技术大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG
Comments Accepted to ICML 2025
机构 * University of North Dakota(北达科他大学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted by IEEE Geoscience and Remote Sensing Magazine
Journal ref IEEE Geoscience and Remote Sensing Magazine, Early Access, 2025
机构 * Center for Project-Based Learning D-ITET, ETH Zürich, Switzerland(项目基于学习中心D-ITET,苏黎世联邦理工学院,瑞士) ; State Key Laboratory of Industrial Control Technology, Zhejiang University, China(工业控制技术国家重点实验室,浙江大学,中国)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * Department of Computer Science, The University of Alabama at Birmingham(亚拉巴马大学伯明翰分校计算机科学系) ; Department of Computer Science, University of Waterloo(滑铁卢大学计算机科学系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
Journal ref IEEE International Conference on Multimedia Information Processing and Retrieval (MIPR) 2025
机构 * ByteDance Douyin Content Group(字节跳动抖音内容团队)
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
Comments ACL 2025 Main Conference
机构 * Tsinghua University(清华大学) ; Zhipu AI(智谱AI) ; Peking University(北京大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted to ICIP2025
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
Comments ICML 2025
机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学) ; Rightly Robotics(Rightly机器人公司) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Academy(中关村学院)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
Comments Accepted to ACL 2025 (main), camera-ready version
机构 * Zhejiang University(浙江大学) ; Byte Dance(字节跳动) ; National University of Singapore(新加坡国立大学) ; Angelalign Inc China(Angelalign中国公司) ; Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV