车载激光雷达的一次扫描只占目标三维体积约1%,其余位置既没有几何信息,也没有类别标签。复旦大学、卡内基梅隆大学提出生成式语义场景补全GSSC,用一套离散扩散框架同时合成训练数据、从噪声生成完整场景,并修正已有模型的输出。
在SemanticKITTI隐藏测试上,最强基础模型经过一步修正、且不使用测试时增强时达到38.8% mIoU,比相同因果、单扫描、单样本限制下此前公开成绩高2.1个百分点。四步修正加八视图增强可达39.2%,但已不属于同一计算条件。
一束激光打过去,99%的体积仍是空白
语义场景补全需要从稀疏点云推断车辆、道路、建筑和行人的完整三维占用。难点不只在稀疏:常见道路体素与骑行者等稀有类别的数量差距可超过7000倍,模型很容易用多数类别覆盖少数目标。
GSSC把输出表示成离散语义体素,让扩散过程在类别概率上逐步去噪。输入包括稀疏三维特征流和鸟瞰语义图,模型不必先构造一张连续深度图,再单独分类每个体素。
图1:单次激光雷达只观测约1%的体积,任务要恢复稠密几何和语义类别。
先造稀疏—稠密配对,再处理长尾
团队设计PS³数据生成流程:先合成完整带标签场景,再通过射线追踪模拟传感器扫描,得到严格对应的稀疏观测和稠密真值。生成数据与SemanticKITTI共同训练,稀有类别在训练池中的出现频率明显增加。
与只对真实数据做重采样相比,这种方式改变了场景本身的组合,模型能看到更多骑行者、摩托车和其他长尾对象所处的空间关系。不过合成分布仍由生成器和渲染设置决定,不能保证覆盖真实道路的全部尾部情况。
图2:PS³先生成完整标注场景,再回放激光扫描,形成配对训练样本。
同一扩散器既能从零生成,也能一步修正
SGSC从纯类别噪声开始,在稀疏扫描条件下生成完整体素场景。S²D²则把已有补全模型的输出作为结构化起点,通过流匹配向真值方向移动一步。后者不要求重新训练基础模型,也不在测试时更新基础参数。
论文把S²D²接到多个外部补全模型上,测试的基础模型都获得提升。可视化中,道路边缘、车辆区域和长尾对象的语义更完整;这些图像属于案例证据,数值结论仍以隐藏测试集的mIoU为准。
图3:同一修正器作用于多个冻结基础模型,补充缺失结构并调整语义标签。
38.8%与39.2%对应两套计算条件
项目页把排行榜结果拆成可比设置。38.8%使用一步修正、无测试时增强,对应论文强调的因果单扫描条件;39.2%使用四步修正和八视图集成,计算更多,因此不能把两者写成同一效率下的连续提升。
图4:一步无增强达到38.8% mIoU;四步八视图设置达到39.2%,限制条件不同。
从基准扩展到真实道路部署
代码、模型和合成数据已经通过项目仓库提供。下一步可以检验这一统一扩散框架能否迁移到不同激光雷达线数、雨雾天气和城市分布,并比较一步修正带来的时延是否满足车端预算。
现有成绩来自SemanticKITTI,实际车辆还会遇到标定误差、动态遮挡和传感器老化。部署评测需要同时观察总体mIoU、稀有类别召回、连续帧稳定性与最坏场景,而不能只追求一个平均分。
生成数据也需要持续审计。若合成池反复出现相似姿态,类别数量增加并不等于有效多样性增加。按物体距离、遮挡程度、天气和传感器视角分层统计,才能判断长尾改善来自真正的新场景,还是简单复制更多体素。
连续帧的一致性还没有被标题数字覆盖,后续测试应补上这一维度。
参考资料
https://shichen.world/GSSC-project-page/