2503.17736
2026-02-04
cs.CV
cs.AI
cs.CL
66%
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互
Yiming Zhao, Yu Zeng, Yukun Qi, YaoYang Liu, Xikun Bao, Lin Chen, Zehui Chen, Qing Miao, Chenxi Liu, Jie Zhao, Feng Zhao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Xi’an Jiaotong University(西安交通大学)
专题命中
视觉问答
:vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)
AI总结
V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。