Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
展示而非讲述:在生成像素而非语言模型文本中评估空间认知
机构 * Zhejiang University(浙江大学)
专题命中 Agent评测 :agentic(abstract)
AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。
Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/