Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
基于框架的思考:视觉上下文和测试时扩展如何增强视频推理
Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen
机构
*
University of Cambridge(剑桥大学)
;
Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学)
;
Hong Kong University of Science(香港科学大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Peking University(北京大学)