CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning
CineCap: 基于时空锚点的结构化推理用于电影化视频描述
机构 * The Chinese University of Hong Kong(香港中文大学) ; Xiamen University(厦门大学) ; Kling Team, Kuaishou Technology(快手科技Kling团队) ; National University of Singapore(新加坡国立大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。
Comments 10 pages, 4 figures