Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
视频变形到掩码:用于指认视频分割的流匹配
机构 * SGIT AI Lab, State Grid Corporation of China(国网信通研究院) ; University of California, San Diego(加州大学圣地亚哥分校) ; The Hong Kong University of Science and Technology(香港科技大学) ; The University of Tokyo(东京大学) ; University of Cambridge(剑桥大学) ; Zhejiang University of Technology(浙江工业大学) ; Baidu(百度)
AI总结 本文提出FlowRVS框架,将指认视频分割视为条件连续流问题,通过学习视频整体表示到目标掩码的直接语言引导变形,在多个基准上取得新突破。