Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
机构 * NVIDIA
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * NVIDIA
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV
机构 * University of California, Riverside(加州大学河滨分校) ; University of Michigan(密歇根大学) ; Meta AI
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025); Project Website: rdd-neurips.github.io
机构 * Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Appendix will be appended soon
机构 * Beihang University(北航) ; M-A-P ; The Hong Kong Polytechnic University(香港理工大学) ; AIWaves ; University of Alberta(阿尔伯塔大学) ; University of Waterloo(滑铁卢大学) ; University of Manchester(曼彻斯特大学) ; Chinese Academy of Sciences(中国科学院) ; Peking University(北京大学) ; Shanghai AI Lab(上海AI实验室) ; Nanjing University(南京大学) ; Kuaishou Technology(快手科技)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments EMNLP 2025 (Oral). Codes and models are available in https://github.com/MIO-Team/MIO
Journal ref EMNLP 2025
机构 * Department of Electronics, Information and Bioengineering(电子、信息与生物工程系)
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV
Comments to appear in NeurIPS 2025