URaG: Unified Retrieval and Generation in Multimodal LLMs for Efficient Long Document Understanding
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract)
Comments Accepted by AAAI 2026 (Oral)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract)
Comments Accepted by AAAI 2026 (Oral)
机构 * Ketong Chen, Yuhao Chen, Yang Xue(作者)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV