Browse and Concentrate: Comprehending Multimodal Content via prior-LLM Context Fusion
浏览与聚焦:通过先验LLM上下文融合理解多模态内容
机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) ; Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) ; Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国)
专题命中 其他VLM :multimodal large language model(abstract)
AI总结 本文提出浏览与聚焦两阶段范式,通过融合先验LLM上下文提升多模态内容理解,显著提升多图像场景的性能。
Comments 17 pages, 5 figures
Journal ref ACL 2024