Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
基于框架的思考:视觉上下文和测试时扩展如何增强视频推理
机构 * University of Cambridge(剑桥大学) ; Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) ; Hong Kong University of Science(香港科学大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Peking University(北京大学)
专题命中 长视频与时序推理 :video reasoning(title);video generation(abstract);分类 cs.CV
AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。
Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)