机构
*
Alibaba Group(阿里巴巴集团)
;
New York University(纽约大学)
;
National University of Singapore(新加坡国立大学)
;
Singapore Management University(新加坡管理大学)
;
Singapore University of Technology and Design(新加坡科技设计大学)
Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning
对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理
Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi
机构
*
Tongji University(同济大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
East China Normal University(华东师范大学)
;
Stanford University(斯坦福大学)
;
New York University(纽约大学)
AI总结
本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。
Comments14 pages, 7 figures, 6 tables; Accepted by ICCV 2025