DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences
DELTAVID:利用跨视频差异增强细粒度时空感知
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Kuaishou Technology(快手科技)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视频多模态大语言模型缺乏精确局部时空感知问题,提出DELTAVID框架,将跨视频找差异转化为可训练感知信号,还引入相关数据集,提升了跨视频差异理解性能并能迁移到通用视频理解基准。