DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
DAVE: 一种用于文档理解与网络代理的视觉编码器
机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) ; UC Berkeley(加州大学伯克利分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。