GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样
机构 * Newcapec AI Research(新开普人工智能研究院) ; Fudan University(复旦大学) ; Tongji University(同济大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。
Comments Published as a conference paper at CVPR 2026