VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models
VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法
机构 * Tencent(腾讯)
专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI
AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。