Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning
对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理
机构 * Tongji University(同济大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; New York University(纽约大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。
Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025