StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models
StateSight:评测视觉语言模型中的潜在空间状态重建能力
机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科学技术高中)
专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究推出StateSight基准及配套数据集StateSight-Steps,评估视觉语言模型的潜在空间状态重建能力,发现GPT-5.5、Claude Sonnet 5的表现均逊于人类基线,格式正确的响应可能掩盖空间结构恢复失败的问题。