MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos
MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准
机构 * NVIDIA, USA(NVIDIA美国分公司) ; University of Maryland, College Park, USA(马里兰大学帕克分校)
AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。
Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU