HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2025
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Rochester(罗切斯特大学)
专题命中 其他VLM :vision-language model(abstract)