Towards Visual Text Grounding of Multimodal Large Language Model
机构 * Adobe Research(Adobe研究院) ; University of Maryland(马里兰大学) ; University at Buffalo(布法罗大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG