视觉模型能描述眼前的桌椅,却未必知道自己走到了房间哪一侧。字节跳动Seed、浙江大学和新加坡国立大学推出GST-Bench,测试22个视觉语言模型后,最强零样本模型得分42.68,人类为79.08,相差36.4分。
基准要求模型看完第一视角探索视频,再回答自身位置、目标物位置和整体场景结构。部分问题给出视频里从未出现的查询视角,模型还要把沿途观察映射到俯视图。
从“看到什么”升级到“整栋房子怎么排”
GST-Bench覆盖6790分钟合成视频,问题经过人工核验。12类任务被归入自我定位、物体定位、场景结构理解三组。模型不能只识别当前帧里的物体,还要把不同时间、不同朝向的局部画面合并成一致地图。
论文图1:模型需从第一视角视频完成自我定位、目标定位和俯视场景重建。
难点集中在跨视角整合。方向估计上,人类得分85.00,最强模型21.52;全局位置估计上,人类93.00,模型42.23。多数开源模型在20至30分附近,部分接近随机猜测。
论文图2:十二类问题同时覆盖局部视角、未知视点与不同抽象程度的俯视图。
局部题会做,线索一拉长就散
团队另建GST-Bench-Local,把目标放回当前画面,或直接移除探索视频。专有模型在局部版本上明显更强,说明它们能识别单帧空间关系,失败主要发生在把长视频线索合并为全局表示的阶段。具身领域专门调过的模型也没有消除这一盲区。
论文图4:Global要求跨帧整合,Local-Video与Local-Image逐步移除全局推理需求。
作者还发布GST-Train。Qwen3-VL-8B经针对性训练后达到53.52分,高于其零样本表现,仍距人类基线约25.6分。训练能补一部分能力,尚未证明模型形成了稳定、可迁移的空间地图。
合成场景给出诊断,不等于真实导航
合成环境可以精确控制位置、视角和俯视真值,也让题目规模化生成。它没有完整覆盖真实相机噪声、动态人员、遮挡变化和机器人行动误差。42.68分说明当前模型在这套受控测试中存在缺口,不能直接换算成现实机器人迷路概率。
下一步更关键的验证,是把同类问题放进真实建筑与连续行动中,观察模型的地图是否会随时间漂移,以及一次错误定位会不会持续污染后续判断。