SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
SMART: 基于音频增强多模态大模型的镜头感知视频时刻检索
机构 * Department of Computer Science, University at Albany - SUNY(University at Albany - SUNY 计算机科学系) ; School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) ; Nanjing University(南京大学) ; Xiamen University(厦门大学) ; Department of Mathematics and Statistics, University at Albany - SUNY(University at Albany - SUNY 数学与统计学系)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 提出SMART框架,融合音频与视觉特征,利用镜头感知令牌压缩技术,在多模态大模型基础上实现视频时刻检索,在Charades-STA和QVHighlights上取得显著提升。