Describe Anything Model for Visual Question Answering on Text-rich Images
机构 * AI VIETNAM Lab(AI越南实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Wisconsin - Madison(威斯康星大学麦迪逊分校) ; University of Pittsburgh(匹兹堡大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Northwestern University(西北大学)
Comments 11 pages, 5 figures. Accepted to VisionDocs @ ICCV 2025