机构
*
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Microsoft Research(微软研究院)
;
National University of Singapore(新加坡国立大学)
;
Technical University of Dresden(德累斯顿技术大学)
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
基于框架的思考:视觉上下文和测试时扩展如何增强视频推理
Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen
机构
*
University of Cambridge(剑桥大学)
;
Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学)
;
Hong Kong University of Science(香港科学大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Peking University(北京大学)
机构
*
National University of Singapore(新加坡国立大学)
;
Stanford University(斯坦福大学)
;
Peking University(北京大学)
;
UniMelb(墨尔本大学)
;
University of Auckland(奥克兰大学)
;
MBZUAI(穆斯林人工智能研究所)
;
University of California, Santa Barbara(加州大学圣芭芭拉分校)
专题命中
视觉推理
:vision language model(abstract);分类 cs.CV