STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
STVG-R1: 通过强化学习激励视频中实例级推理与 grounding
机构 * Xidian University(西电大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; Beijing Institute of Technology(北京理工大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 STVG-R1通过强化学习框架提升视频中实例级推理与 grounding 的准确性,实现显著的性能提升和泛化能力。