Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models
视觉生成通过多模态世界模型解锁类人推理
机构 * Tsinghua University(清华大学)
专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出视觉生成在特定任务中优于纯语言推理,通过构建VisWorld-Eval评估套件验证了多模态世界模型提升类人推理的能力。
Comments Project page: https://thuml.github.io/Reasoning-Visual-World