PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; Tsinghua, Beijing, China(清华大学) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI