论文导读
香港科技大学(广州)、粤港澳大湾区数字经济研究院、香港科技大学等机构提出SatNav,用卫星影像构建城市级无人机语言导航测试。系统从18座城市的59个场景生成约11.8万条任务轨迹,平均路径长379米,让模型学习沿道路、水道和地标完成较长距离的指令。论文还用真实飞行观测测试从卫星视角训练的模型,为大规模导航研究提供了比逐城重建三维环境更易扩展的路径。
无人机听懂“沿河飞”,比找一个点难得多
普通导航可给无人机一个坐标;语言导航则可能要求“沿水边走,到下一座桥左转,在路口停下”。它需要持续记住已经经过哪些地标、现在相对路线在哪里。距离一长,模型一旦忘记前面的指令,便可能在看似相近的河湾或十字路口转错方向。许多现有测试场景依赖昂贵的三维重建,扩展到很多城市时,制作和维护都很费力。
SatNav换了输入来源:使用高分辨率卫星影像作为俯视观察的近似,并结合地图线索自动构造路径和语言任务。团队从图中可见的道路、桥梁、水道、封闭边界和显著地标提取线索,再生成沿边界绕行、识别地标、按路线前进等任务。图片左侧是卫星图和地图标注,中间提取空间线索,右侧叠加可执行的路径与文字指令。
图:卫星影像和地图标注经过地理线索提取,形成路线与导航指令。
11.8万条轨迹测的不只是看图
论文构建约118K个任务回合,来自59个场景、18座城市,平均轨迹长度379米。三类任务分别强调不同能力:Boundary要求沿封闭边界保持前进方向并知道何时绕完;Landmark要求利用可识别建筑或设施定位;Route要求根据道路、水道、转弯和计数线索执行较长路线。这些任务把“记住一路走过什么”放进评估,而不仅是看当前画面猜下一步。
建筑绕行示例里,左侧给出起点和环绕方向,右侧列出一连串俯视观察帧。无人机要保持建筑在指定一侧,绕完后回到起始区域。静态截图展示任务定义与观察序列,不能把它直接当成真实飞行的完整实拍;SatNav主体仍是卫星影像生成的基准环境。
图:建筑边界任务标出环绕方向,并给出连续俯视观察与语言指令。
从卫星图到真实飞行,还有一道坎
团队比较了经典导航智能体与较新的视觉语言模型方案,发现城市尺度、长距离的指令执行仍然困难。为此,论文还提出SwiftVLN,研究不同记忆组件对导航的影响。卫星图有广阔覆盖范围,但与真实无人机相机画面并不一样:分辨率、拍摄角度、光照和动态障碍都会变化。因此论文加入卫星训练到真实飞行观测的迁移实验,报告模型能够在实飞观察上运行,说明这条路线并非只停留在卫星图上。
另一张案例图展示沿池塘边界行进的任务。左侧蓝线给出区域边缘,右侧展示连续位置和不同详略程度的语言指令。这样的材料适合训练与评估“保持方向、寻找终点”的能力,但不意味着无人机已经获得任何城市里自主安全穿行的资格。实飞部署还需要空域、避障、定位冗余和安全监管体系配合。
图:池塘边界路线、连续卫星裁片和三种详略的导航指令示例。
下一步是更接近真实城市的检验
SatNav的价值首先是研究基础设施:让不同团队在更多城市、更长路线和统一任务定义下比较导航能力。对低空巡检或物流来说,卫星资料若能承担大规模预训练和测试的一部分,就可能减少重复搭建模拟世界的成本。未来要检验的是,模型如何应对施工、树木遮挡、航线临时变化以及相机视角与卫星图的偏差。论文展示的是可扩展基准与初步迁移证据,离稳定运营仍有工程距离。
参考资料
https://arxiv.org/abs/2609.31507