TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs
TimeBlind: 一种用于视频大语言模型的时空组合性基准
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Pittsburgh(匹兹堡大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 TimeBlind通过细粒度时空理解基准揭示视频大语言模型对时间动态理解的不足,展示其在实例准确率上的显著劣势,强调对静态视觉捷径的依赖。
Comments For code and data, see https://baiqi-li.github.io/timeblind_project/