Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
通过视频思考:视频生成作为一种有前途的多模态推理范式
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) ; College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; The Chinese University of Hong Kong(香港中文大学) ; Central South University(中南大学) ; Fudan University(复旦大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。
Comments 34 pages, 17 figures