2608.25529
2026-08-27
cs.CV
新提交
Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios
Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao
机构
*
TJU(天津大学)
;
Tencent Youtu Lab(腾讯优图实验室)
;
SJTU(上海交通大学)
;
Tencent Hunyuan(腾讯混元)
;
CUHK(香港中文大学)
;
NTU(南洋理工大学)
AI总结
本文推出Video-IFBench基准,构建含四类模板的指令分类体系与半自动数据 pipeline,评估20余种MLLMs的视频指令遵循能力,发现当前模型在复杂指令上仍具挑战,推动相关研究。