Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 具身推理 :robotic(title,abstract);embodied AI(abstract);manipulation(abstract);分类 cs.CV
AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。
Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/
Journal ref International Conference on Learning Representations (ICLR), 2026