Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
通用视频时间定位与生成多模态大语言模型
机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ; ByteDance Seed(字节跳动种子)
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。