A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
大规模多模态数据集与基准用于人类活动场景理解和推理
机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Columbia University(哥伦比亚大学) ; University of Pittsburgh(匹兹堡大学)
专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。