Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning
知识完善视觉:一种多模态实体感知检索增强生成框架用于新闻图像描述
专题命中 多模态RAG :retrieval-augmented generation(title,abstract);分类 cs.AI
AI总结 MERGE提出了一种多模态实体感知检索增强生成框架,通过构建实体中心知识库和改进跨模态对齐,提升新闻图像描述质量和命名实体识别性能。
Comments Accepted to AAAI 2026