PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration
PositionOCR: 通过混合专家整合增强多模态模型的位置意识
专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 PositionOCR通过整合文本定位专家与LLM的上下文能力,提升多模态模型在文本定位和定位任务中的位置准确性。