arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

CrowdTraj:真实拥挤环境下密集人群轨迹预测基准

CrowdTraj: A Benchmark for Dense Crowd Trajectory Prediction in Realistic Crowded Environments

Antonius Bima Murti Wijaya, Paul Henderson, Marwa Mahmoud

arXiv 2609.07685首次发表:更新:

AI 中文总结

提出CrowdTraj基准,用于真实密集人群场景下的行人轨迹预测,支持端到端评估,揭示现有方法在跟踪噪声和计算开销上的局限。

AI 中文摘要

在现实应用中,行人轨迹预测模型依赖于检测和跟踪系统的输入。以往的轨迹预测基准要么包含相对稀疏的行人交互,要么假设完美的跟踪输入,要么依赖能够最小化遮挡和透视畸变的俯视视角,这限制了在真实密集人群场景中的评估。我们提出了CrowdTraj,一个用于自然密集人群场景中行人轨迹预测的基准。与以往数据集不同,CrowdTraj支持在闭路电视视角下严重遮挡情况下,从检测到跟踪再到轨迹预测的端到端评估。它还捕捉了多样化的自然行人行为,包括现有基准中很少观察到的突然方向变化。CrowdTraj包含五个多样化的场景,每个场景平均有1,146个独特行人,最大帧级密度范围从114到372个行人,并拥有超过320万个标注的头部边界框。CrowdTraj通过每个场景的单应性矩阵提供像素和真实世界坐标,以便进行有物理意义的分析。我们的实验结果表明,在最密集的场景中,跟踪精度(IDF1)降至0.68至0.70,而在不那么拥挤的场景中约为0.90。轨迹预测训练在密集场景中也变得计算上更加昂贵,训练时间最多增加8倍。这些发现表明,CrowdTraj揭示了当前轨迹预测流程中的局限性,这些局限性在现有稀疏人群基准中仍然隐藏,特别是在对跟踪噪声的鲁棒性和计算可扩展性方面。

英文摘要

In real-world applications, pedestrian trajectory prediction models rely on inputs from detection and tracking systems. Prior trajectory prediction benchmarks either contain relatively sparse pedestrian interactions, assume perfect tracking inputs, or rely on overhead viewpoints that minimize occlusion and perspective distortion, limiting evaluation in realistic dense-crowd scenarios. We present CrowdTraj, a benchmark for pedestrian trajectory prediction in natural dense crowd scenes. Unlike previous datasets, CrowdTraj supports end-to-end evaluation from detection through tracking to trajectory prediction under severe occlusion in CCTV views. It also captures diverse, natural pedestrian behaviours, including abrupt directional changes rarely observed in existing benchmarks. CrowdTraj includes five diverse scenes, with an average of 1,146 unique pedestrians per scene, maximum frame-level densities ranging from 114 to 372 pedestrians, and over 3.2 million annotated head bounding boxes. CrowdTraj provides pixel and real-world coordinates via per-scene homography matrices for physically meaningful analysis. Our experimental results show that tracking accuracy (IDF1) drops to 0.68 to 0.70 in the densest scenes, compared with approximately 0.90 in less crowded scenes. Trajectory prediction training also becomes substantially more computationally expensive in dense scenes, with training times increasing by up to 8 times. These findings show that CrowdTraj exposes limitations in current trajectory prediction pipelines that remain hidden on existing sparse-crowd benchmarks, particularly in robustness to tracking noise and computational scalability.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑