How to Utilize Complementary Vision-Text Information for 2D Structure Understanding
如何利用互补的视觉-文本信息进行2D结构理解
机构 * City University of Hong Kong(香港城市大学) ; Baidu Inc(百度公司)
AI总结 本文提出DiVA-Former架构,通过动态查询视觉标记将长文本序列压缩为摘要向量,有效整合视觉与文本信息,在13个表格基准测试中提升23.9%。
Comments 16 pages, 5 figures