Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
通用视频时间定位与生成多模态大语言模型
机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ; ByteDance Seed(字节跳动种子)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。