VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
VideoPerceiver: 提升视频多模态大语言模型的细粒度时序感知能力
机构 * State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室)
专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV
AI总结 VideoPerceiver通过两阶段训练框架提升视频多模态大语言模型对细粒度动作和短暂事件的感知能力,显著优于现有模型。