PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
感知基准:评估多模态大语言模型中的原子视觉感知
机构 * Moonshot AI(登月人工智能)
AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。
大厂专区
感知基准:评估多模态大语言模型中的原子视觉感知
机构 * Moonshot AI(登月人工智能)
AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。