MuSLR:多模态符号逻辑推理
MuSLR: Multimodal Symbolic Logical Reasoning
- National University of Singapore(新加坡国立大学)
- Stanford University(斯坦福大学)
- Peking University(北京大学)
- UniMelb(墨尔本大学)
- University of Auckland(奥克兰大学)
- MBZUAI(穆斯林人工智能研究所)
- University of California, Santa Barbara(加州大学圣芭芭拉分校)
机构由 AI 辅助整理,请以论文原文为准。
AI总结:
MuSLR提出了一种多模态符号逻辑推理基准,通过形式逻辑规则提升VLMs的推理能力,显著提升链式推理性能及复杂逻辑处理效果。
AI中文摘要:
多模态符号逻辑推理旨在通过形式逻辑从多模态输入中推导出新事实,这对于高风险应用如自动驾驶和医学诊断至关重要,因为其严格、确定性的推理有助于防止严重后果。为了评估当前最先进的视觉语言模型(VLMs)在此方面的能力,我们引入了首个基于形式逻辑规则的多模态符号逻辑推理基准MuSLR。MuSLR涵盖7个领域共1,093个实例,包括35个原子符号逻辑和976个逻辑组合,推理深度范围从2到9。我们评估了7个最先进的VLMs在MuSLR上的表现,发现它们在多模态符号推理方面都存在困难,最佳模型GPT-4.1仅达到46.8%。因此,我们提出了LogiCAM,一个应用形式逻辑规则到多模态输入的模块化框架,使GPT-4.1的链式推理性能提升14.13%,并在复杂逻辑如一阶逻辑上实现更大的提升。我们还进行了全面的错误分析,发现约70%的失败源于模态间的逻辑不一致,为未来改进提供了关键见解。所有数据和代码均可在https://llm-symbol.github.io/MuSLR公开获取。
英文摘要:
Multimodal symbolic logical reasoning, which aims to deduce new facts from multimodal input via formal logic, is critical in high-stakes applications such as autonomous driving and medical diagnosis, as its rigorous, deterministic reasoning helps prevent serious consequences. To evaluate such capabilities of current state-of-the-art vision language models (VLMs), we introduce the first benchmark MuSLR for multimodal symbolic logical reasoning grounded in formal logical rules. MuSLR comprises 1,093 instances across 7 domains, including 35 atomic symbolic logic and 976 logical combinations, with reasoning depths ranging from 2 to 9. We evaluate 7 state-of-the-art VLMs on MuSLR and find that they all struggle with multimodal symbolic reasoning, with the best model, GPT-4.1, achieving only 46.8%. Thus, we propose LogiCAM, a modular framework that applies formal logical rules to multimodal inputs, boosting GPT-4.1's Chain-of-Thought performance by 14.13%, and delivering even larger gains on complex logics such as first-order logic. We also conduct a comprehensive error analysis, showing that around 70% of failures stem from logical misalignment between modalities, offering key insights to guide future improvements. All data and code are publicly available at https://llm-symbol.github.io/MuSLR.