Zero-shot Multimodal Document Retrieval via Cross-modal Question Generation
机构 * Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI