arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

美团&上交等打造UrbanGround:把AI智能体放进真实尺度城市

作者:arXivDaily编辑部 arXiv 2608.27456 cs · cs.CV

看懂一张街景,并不等于能沿着街道走到目的地。上海交通大学、美团、新加坡国立大学等机构提出UrbanGround,把真实尺度城市地理数据装进可交互的Unity环境,专门检验多模态大模型在连续移动中能否认路、记路并调整路线。

环境包含810个人工核验实例,单次任务最多允许100步交互。研究团队让模型从第一人称视角行动,必要时打开地图,但地图不提供规划好的路线。实验显示,现有模型能识别局部物体,也能完成一部分短距离导航;路线拉长、目标变含糊或行人开始移动后,错误会持续累积。

把城市变成可以连续行动的沙盒

以往城市导航基准常用离散街景或预先采样的全景图。模型从一个视点跳到下一个视点,画面之间并不一定对应连续运动。UrbanGround加载三维城市表面和行人网络,人物受到道路、建筑、坡度和碰撞约束,每次移动都会产生新的第一人称画面。

系统还能改变昼夜、雨雾和行人密度,并在执行途中关闭一段道路。模型不能直接读取当前位置到目标的距离,也拿不到最短路径接口,只能根据当前画面、历史对话和可操作地图维持自己的空间判断。

图1:UrbanGround把城市街景、地图、天气和行人系统放进同一套闭环交互环境。

五级任务把“看见”逐步推到“完成”

第一层测试视觉识别、朝向判断和主动观察;第二层加入短距离、长距离和带约束的导航;第三层要求模型根据含糊意图寻找地点;第四层需要连续完成多个目的地;第五层再加入封路、移动行人和天气变化。

这种设计把失败位置拆得很细。一个模型可能认得眼前建筑,却无法在转过街角后保持方向;也可能能走近目标,但因为忘记路线限制而失败。论文因此没有用一个总分掩盖不同能力,而是分别报告识别、方向、到达、路径依从和动态事件记录。

图2:五级任务从局部识别逐步增加长程导航、多任务规划和动态环境适应。

810个实例暴露长距离错误累积

所有任务都由人类测试者在相同的100步限制内完成,说明任务本身可执行。短距离阶段,模型的识别和局部推理能够支撑一部分行动;距离增加后,方向误差、错误转弯和无效探索迅速增加。模型即使曾经看到正确地标,也常在后续画面中失去这一线索。

实验还比较了封路通知、行人避让以及不同天气下的表现。模型可能理解文字通知,却没有把它持续写进后面的动作;面对行人时,也会出现路线可达但运动不够稳妥的情况。论文的结论很克制:局部能力已经可用,但尚未稳定组合成持续的目标导向行为。

图3:人工核验任务分布在多个城市区域,用不同街道结构和地形检验空间能力。

图4:810个基础实例覆盖五级任务,低层感知与高层规划均被单独计量。

从评测工具走向机器人部署

UrbanGround已经提供网页体验、桌面版本和程序化控制接口,研究者可以替换模型、提示词或记忆模块,复用同一城市和同一批任务。下一步最直接的用途,是检验视觉记忆、地图对齐和错误恢复方法能否真正改善长路线表现,而不只提升单帧问答成绩。

实验仍发生在由地理数据重建的Unity沙盒中,不代表机器人已经在真实街道自主运行。若要走向实体部署,还需处理传感器噪声、定位漂移、真实交通规则以及不可预测的人群互动,并用真实路线的安全数据重新验证。

对模型开发者而言,这套环境还能回答一个具体问题:成绩提升究竟来自视觉模型更强、记忆更长,还是路线策略更会纠错。固定城市与任务后逐项替换模块,可以把这些因素分开测量。

参考资料

https://urbanground.github.io

https://arxiv.org/abs/2608.27456

https://github.com/UrbanGround/UrbanGround