东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。
测试覆盖环境理解、路径推理和空间推理。最强参评模型Gemini 2.5 Flash的总得分为17.1%,人类为77.3%,相差60.2个百分点。论文已被ECCV 2026接收。
从规整3D地图走进招牌密集的秋叶原
许多室外导航基准在编辑器中构建,画面干净、道路结构简单,Agent很少需要处理日文英文混排招牌、外观相似建筑和人车遮挡。360CityArena直接从真实城区视频重建,在可控制环境中保留了这些视觉复杂度。
Agent需要在密集招牌和商店立面中识别目标地标。
评测不仅让Agent按箭头前进。环境理解要求定位和搜索地标,路径推理要求选择街口和规划行程,空间推理则要求判断地标的相对方位和道路关系。
175项任务同时检查看懂、记住和规划
团队人工编写所有任务,避免自动生成问题与环境对不上。一类题要求Agent在当前全景图中找出指定建筑;另一类要先根据地图定位,再决定下一个路口如何转向;还有任务要在多步行走中维持对方向和已经路过地标的记忆。
每个导航步都在真实全景街景中选择前进或转向。
不同难度的差距说明,单帧地标识别不能直接变成稳定城市导航。Agent需要将当前街景、地图、历史轨迹和目标描述保持在同一空间坐标中,一次误定位就会让后续路径全部偏离。
看到地图不等于能把地图对上眼前街口
地图定位任务要求Agent把抽象俯视图与第一人称全景对齐。两种视图的外观差别很大:地图给出道路形状,街景给出建筑、招牌和当前朝向。模型要先找到可区分地标,才能判断自己处于哪个路口。
地图定位需要对齐俯视道路结构与全景街景中的地标。
当前基准运行在360度视频重建的虚拟环境,不包括实体机器人的定位噪声、实时行人避障和底盘控制。因此17.1%是对多模态Agent城市视觉与空间推理的成绩,不是实车或机器人的导航成功率。
环境的规模不只由85条街道体现。602段360度视频覆盖了不同朝向和行走路径,Agent在路口处看到的不是完美对称的纹理,而是招牌、橱窗、停放车辆和街道设施组成的局部线索。对于相邻街区,主题和建筑类型可能高度相似,只有少数店铺名、路牌和路口几何能区分位置。
三大类任务内部还有多个子类。环境理解包括地标搜索、当前位置识别和场景问答;路径推理要比较候选路线、判断下一步行走方向;空间推理关注地标间的左右、前后和街区关系。一个模型在单帧问答上表现较好,也可能在需要多步位置记忆的路径任务中迅速掉分。
人类77.3%的结果同样不是100%,反映出数据集中的部分场景对人也存在模糊性,例如相似店面、遮挡招牌和复杂路口。但Gemini 2.5 Flash与人类之间仍有60.2个百分点差距,这不是单靠放大输入图像就能补齐的细小误差,而是空间对齐、长程记忆和路径决策的组合问题。
下一步扩展更多城区与动态导航
基准还可用来单独比较地图、视觉记忆和语言规划组件。同一条路径可以更换不同地图表示或历史帧索引,观察改动哪一层后定位与转向错误如何变化,而不只更换整个端到端Agent。
360CityArena把可重复评测和真实城市外观结合起来,为导航Agent提供了一个介于简化游戏地图与实地机器人之间的测试层。下一步可以加入时间变化、道路施工、昼夜和更多城区,检验Agent是否能在地标变化后重新定位。
真实街景包含相似店面、密集文字和不规则行走空间。