SPEED-Q: Staged Processing with Enhanced Distillation towards Efficient Low-bit On-device VLM Quantization
机构 * Tianyu Guo, Shanwei Zhao, Shiai Zhu, Chenguang Ma(作者)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Tianyu Guo, Shanwei Zhao, Shiai Zhu, Chenguang Ma(作者)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构 * University of Geneva(日内瓦大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI
Comments Machine Learning and the Physical Sciences Workshop, NeurIPS 2025
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
Comments 12 pages, 5 figures
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments 16 pages, 6 figures, 15 tables
机构 * Nanyang Technological University (NTU)(南洋理工大学) ; MiroMind(米罗Mind) ; Institute for Infocomm Research (I 2 R)(信息与通信研究院) ; A*STAR(科技研究局)
专题命中 VLM训练与架构 :vision-language model(abstract)
Comments Link: https://github.com/AudioLLMs/AudioBench/tree/main/IFEval-Audio