CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs
机构 * Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments EMNLP 2025 main
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
Comments NeurIPS 2025, Project webpage: https://vision.cs.utexas.edu/projects/CrossTrainer/
专题命中 其他VLM :multimodal large language model(abstract)
Comments The paper was presented at IntRS'25: Joint Workshop on Interfaces and Human Decision Making for Recommender Systems, September 22, 2025, Prague, Czech Republic and is published in the workshop proceedings: https://ceur-ws.org/Vol-4027/