arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

NVIDIA&耶鲁发布Spatial-IQ:把空间智能拆成9个子能力逐项考试

作者:arXivDaily编辑部 arXiv 2607.22864 cs · cs.AI · cs.CV

NVIDIA研究院和耶鲁大学的研究人员发表了Spatial-IQ,一个分层诊断框架,把堆叠三维结构中的物体计数拆成9个感知与认知子任务,按人类空间认知的发育阶段组织,外加心理旋转作为补充探针。诊断结论直白:最好的模型Qwen在人类基线任务上只拿到17.7%,最差的Qwen2.5-3B只有2.1%,而人类的表现远高于所有模型。数据在NVIDIA Isaac Sim里程序化生成,已随论文公开。

黑箱评测找不到病因

多模态大模型看图说话的能力越来越强,空间推理却始终拖后腿:人一眼能数清的积木堆,模型数不明白。现有的基准把这些任务当黑箱测——只报一个总分,模型答错时说不清卡在哪一步:是看不清物体边界(感知问题),还是推不出被遮挡的几何(认知问题)。病因不明,改进就只能靠猜。

Spatial-IQ的思路是照着发展心理学的剧本拆任务。皮亚杰和英海尔的空间认知发育研究把儿童的空间能力分成有序的阶段,Spatial-IQ据此把物体计数分解成9个子任务:从可见物体计数、遮挡物体计数,到需要内部参照链、遮挡推理和隐式支持的组合任务,难度沿发育阶梯排列。心理旋转作为独立探针单独评估。

场景用Isaac Sim程序化生成:物体是纹理立方体、工厂箱、汤罐或肉罐,摆在4×4×4的体素网格里,遮挡关系可控、真值精确。

图:皮亚杰六阶段空间认知发展与Spatial-IQ的五项子能力对应关系(论文Figure 12)。

人类97%,模型17%

文本模态的结果先定基调:人类计数准确率从物体最少时的97.2%降到最多(26个以上)时的76.9%,无遮挡时92.4%、四层以上遮挡时76.1%——人有下降曲线,但整体远高于模型。模型一侧,Qwen的17.7%已是全场最高,比最差的Qwen2.5-3B的2.1%高出一个数量级。

黑箱总分掩盖的结构被子任务拆了出来:Visible Object Count一项,从GLM的20.3%到Claude的52.6%,模型间的差距极大。这意味着失败不是均匀的能力缺失,而是特定环节的断裂——有的模型数得清看得见的,推不出被挡住的;有的连第一步都吃力。

图:Spatial-IQ的9个子任务定义,从物体计数到遮挡推理逐级加难(论文Figure 2)。

同分的模型,不同的大脑

诊断框架最锋利的一刀在机制分析。Qwen和Gemini的总分接近,但机制完全不同:人类计数符合求和机制——可见与隐藏两个分项都对时准确率集中在90.6%,对错任何一个分项就单调衰减;Qwen最接近人类签名,两分项全对占88.9%,精确匹配率64.2%;Gemini总分相当,两分项全对却只有48.0%,精确匹配18.6%——分数靠猜对的比例撑起来的。

图像模态里同样有 dissociation:Qwen-Image-Edit的内部参照链完整性是该模态最高(0.676),原始可见计数准确率却只有3.3%——链条完整,落地稀碎。

图:人类被试与Gemini在仓库计数任务上的对话对比,模型在隐藏物体推理上出错(论文Figure 1)。

图:Spatial-IQ的场景示例与微调收益:在Spatial-IQ数据上训练后计数能力显著提升(论文Figure 1)。

下一步:从诊断到定向训练

诊断的价值最终要看能不能指导治疗。团队用Spatial-IQ数据对模型做专项微调对比:7B规模上,SFT-CoT与SFT-plain几乎打平(1.1分差距);32B规模上分解式监督拉开6.6分。DAPO-tight的收益最大:7B上超过SFT-CoT 9.9分,32B上15.9分,把目标任务准确率从零样本基线的2.9%推到62.6%。

图:物体计数准确率随五项难度控制(物体数、遮挡数、层数、列数、填充率)的变化,人类为黑色基线(论文Figure 6)。

这套框架对机器人、空间Agent和具身智能的开发者是直接可用的工具:先定位模型断在感知还是认知层,再对症下药。论文也给出了一条可执行的路径:把失败拆到子任务粒度,再用分解式监督和强化学习做定向训练,而不是继续堆通用数据。论文的数据与代码均已公开,诊断驱动的定向训练替代盲目堆数据,是它给出的路线。

参考资料

https://arxiv.org/abs/2607.22864

https://nvidia.github.io/Spatial-IQ/

https://github.com/NVIDIA/Spatial-IQ

https://huggingface.co/datasets/patrickqrim/spatial-iq