中国农业大学、北京师范大学和新加坡国立大学联合提出了TIDE(Tracking Identities with Dual-branch Elasticity),一种用于密集同质目标跟踪的双分支弹性框架。在MFT-Edge基准上,轻量L分支仅用20.47G FLOPs就达到了28.43的HOTA,相比重型基线SU-T的792G FLOPs,计算量降低了38.7倍。
鱼群跟踪为什么难
对鱼群等密集同质目标进行跟踪,是多目标跟踪领域的一个特殊挑战。问题在于三个特征的叠加:个体间极端的相似性——所有鱼看起来几乎一样,无法通过外观区分;严重的物理聚类——鱼群密集时,个体之间几乎没有空间间隙;快速的非刚性形变——鱼的身体在不断弯曲和摆动。
传统的分离检测和嵌入跟踪方法(如SU-T)通过复杂的重识别网络来区分个体,在大计算量的支持下确实取得了高精度。但问题在于,这些方法在计算受限的边缘设备上无法部署,而鱼群监测恰恰需要在边缘设备上运行。
绕过外观线索,用空间和结构一致性做关联
TIDE的核心创新是绕过昂贵的外观线索,转而利用空间和结构一致性。具体来说,TIDE提出了自适应几何对应IoU(Adaptive Geometric Correspondence IoU),一种关联机制,使用目标的位置和形状信息来匹配不同帧中的同一目标,而不需要提取外观特征。
这种做法的好处是计算量大幅降低,同时不受外观变化的影响。在严重遮挡导致外观特征退化的情况下,基于几何的关联仍然有效。
换个角度看,这其实是承认了一个事实:在密集同质场景里,外观特征本身就没什么信息量。重识别网络花大量算力提取出的嵌入向量,在一群长得几乎一致的鱼之间区分度很低。既然这条线索不可靠,与其投入算力去榨取它,不如转向真正有区分度的信息——目标在上一帧的位置、运动趋势和轮廓形状。
图:TIDE在密集鱼群视频中的检测与轨迹跟踪结果。
图:TIDE的关键帧检测、轨迹预测与关联框架。
双分支弹性:不是二选一,而是按需切换
TIDE的"双分支弹性"设计是另一个关键特性。系统包含两个分支:
轻量L分支(Lightweight):专注于低计算量,使用简化的几何关联,适合边缘设备部署。在MFT-Edge上达到HOTA 28.43,计算量仅20.47G FLOPs。
可扩展S分支(Scalable):在计算资源充足时使用更复杂的几何建模,追求更高精度。HOTA达到29.98,弥合了高精度云分析与高效边缘跟踪之间的差距。
两个分支共享同一个算法框架,只是在几何建模的复杂度上有所不同。系统可以根据部署环境在两者之间弹性切换。
图:TIDE轻量化检测头与解码流程。
鱼群数据集的挑战性
MFT-Edge基准包含了不同密度、不同光照条件、不同鱼种的真实水下视频。从论文提供的可视化结果可以看到,密集鱼群场景中个体之间的外观几乎无法区分,存在严重的遮挡和重叠。
在这种极端条件下,TIDE的L分支仍然保持了有意义的跟踪效果。S分支则在精度上进一步接近了重型基线的水平。
图:密集鱼群跟踪中的遮挡、漏检与身份切换难点。
精度与效率的帕累托前沿
TIDE在MFT-Edge上展示了精度与效率的帕累托前沿。在20.47G到约792G FLOPs的计算区间内,TIDE覆盖了从边缘到云端的不同部署需求。对于一个给定的计算预算,用户可以选择最合适的配置。
在边缘部署场景(L分支,20.47G FLOPs),HOTA为28.43;在云分析场景(S分支),HOTA为29.98。重型基线SU-T的HOTA为34.41,但计算量高达792G FLOPs。TIDE在保留了大部分精度的同时,将计算量降低了近两个数量级。
这个取舍是否划算,取决于应用要什么。水产养殖场的日常巡检关心的是鱼群整体状态——摄食是否活跃、有无异常聚集、密度是否均匀,几个百分点的HOTA差距对这类判断影响有限;而如果要做个体级的长期行为追踪,精度损失就需要认真评估了。
图:多种跟踪方法在计算量与跟踪精度之间的权衡。
从鱼群跟踪扩展到更广的密集目标应用
虽然TIDE的验证场景是鱼群跟踪,但它的核心方法——用几何对应替代外观匹配、双分支弹性部署——可以推广到其他密集同质目标的跟踪场景,如细胞跟踪、昆虫群体行为分析、交通流量监测等。
特别是对于需要实时处理、计算资源受限的场景,TIDE的轻量分支提供了一个可行的方案。数据集和代码已经开源,便于后续研究者在此基础上进行扩展。