Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension
放大关键信息:面向视觉文本理解的注意力引导自适应渲染
机构 * Michigan State University(密歇根州立大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 针对视觉语言模型在视觉文本理解任务中存在的定位与利用脱节问题,提出无需训练、模型无关的注意力引导自适应渲染方法AGAR,通过放大关键文本跨度提升模型性能。