CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
CaC:通过分层时空聚焦推进视频奖励模型
机构 * BJTU(北京工业大学) ; NTU(国立台湾大学) ; BUPT(北京邮电大学) ; Kuaishou Technology(快手科技)
AI总结 提出基于视觉语言模型的粗到细异常奖励模型CaC,通过全局时间扫描、局部空间定位和结构化时空思维链推理,结合大规模生成视频异常数据集和三阶段渐进训练,显著提升细粒度异常检测精度并减少生成视频异常。
Comments 27 pages, 10 figures