A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images
机构 * Yonsei University(延世大学)
专题命中 视觉定位与Grounding :MLLM(title,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at CVPR 2025 Workshop on Emergent Visual Abilities and Limits of Foundation Models