arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.30498cs.AI

CM2:基于集成多智能体框架的多模态文化推理

CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework

Qi Li, Zhaojie Kang, Yingjie He, Zheng Lin, Hao Zhang, Guangxin Wu, Yan Gong, Rong Fu, Jianyuan Ni

首次发表
浏览论文内容

中文总结 AI 辅助

针对多模态大语言模型(MLLM)跨学科文化推理不足的问题,提出基于人类文化解释认知路径的CM2多智能体框架,在CM2D数据集上较CoT等范式取得一致提升,各模块贡献及跨模态仲裁能力均得到验证。

中文摘要 AI 辅助

多模态大语言模型(MLLM)在STEM领域已取得显著成功,该领域的进展通常由相对稳定符号系统下的垂直逐步推导驱动。然而,它们在横向跨学科文化推理方面仍存在不足。本文提出CM2,一种基于人类文化解释认知路径的多智能体框架,CM2整合了多模态感知、检索增强生成、网络化推理、门控融合及奖励驱动机制。在CM2D数据集上,基于多种MLLM主干的实验显示,CM2相较于思维链(CoT)及典型推理范式取得了一致提升; ablation实验验证了各模块的贡献,冲突分析也证实了其真实的跨模态仲裁能力。

英文摘要

Multimodal Large Language Models (MLLMs) have shown remarkable success in STEM domains, where progress is often driven by vertical, step-by-step deduction under relatively stable symbol systems. Their horizontal, interdisciplinary cultural reasoning, however, remains underexplored.We propose CM2, a multi-agent framework grounded in the cognitive pathway of human cultural interpretation. CM2 integrates multimodal perception, retrieval-augmented generation, networked reasoning, gated fusion, and reward-driven feedback.Experiments on CM2D across multiple MLLM backbones show consistent gains over CoT and typical reasoning paradigms; ablations validate each module's contribution, and conflict analyses confirm genuine cross-modal arbitration.

发表机构

  • Lanzhou University(兰州大学)
  • Peking University(北京大学)
  • Taiyuan University of Technology(太原理工大学)

机构由 AI 辅助整理,请以论文原文为准。

补充信息

↑