LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
LLaVA-UHD v3:渐进式视觉压缩用于多模态大语言模型中的高效原分辨率编码
机构 * Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)
专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 LLaVA-UHD v3通过渐进式视觉压缩方法,实现高效原分辨率编码,减少TTFT并提升多模态大语言模型性能。