arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

基于生物特征、外观和3D人体特征层次融合的身份中心视频摘要

Identity-Centric Video Summarization via Hierarchical Fusion of Biometric, Appearance, and 3D Body Features

Milad Mirjalili, Enrique Alegre Gutiérrez, Eduardo Fidalgo Fernández, Víctor González Castro, Rocío Alaiz Rodríguez, Manuel Castejón Limas

arXiv 2609.25837首次发表:更新:

发表机构

Universidad de León; Institute for Research and Innovation in Engineering (I4)(莱昂大学; 工程研究与创新学院(I4))

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

本文提出一种基于多目标跟踪与行人重识别的视频摘要算法,通过融合面部、3D体型和外观特征实现稳健跟踪,并在自定义数据集上显著提升视觉多样性与时间覆盖率。

AI 中文摘要

本文提出了一种基于多目标跟踪和行人重识别的视频摘要算法。我们将面部嵌入、3D体型特征和视觉外观整合到一个统一的跟踪框架中。这些表示通过双向锚定实现层次化身份分配与跟踪,能够在严重遮挡或低视觉质量下稳健地恢复轨迹。从这些稳定的轨迹中,我们为每个身份生成一组紧凑的摘要。我们使用多因子加权方案选择关键帧,该方案优化了生物特征清晰度、社交互动和运动动态,同时自适应非极大值抑制确保了时间多样性。在自定义数据集上的评估证明了跟踪稳定性,实现了97.89%的IDF1和95.79%的MOTA。与Top-K选择相比,我们的算法还将视觉多样性提高了146%,时间覆盖率提高了89%,信息可检索性提高了3.5%。

英文摘要

This work presents a video summarization algorithm based on multi-object tracking and person reidentification. We integrate facial embeddings, 3D body-shape features, and visual appearance into a unified tracking framework. These representations enable hierarchical identity assignment and tracking through bidirectional anchoring, which robustly recovers trajectories under severe occlusion or low visual quality. From these stable trajectories, we generate a compact set of summaries for each identity. We select keyframes using a multi-factor weighting scheme that optimizes biometric clarity, social interaction, and motion dynamics, while Adaptive Non-Maximum Suppression ensures temporal diversity. Evaluation on a custom dataset demonstrates tracking stability, achieving an IDF1 of 97.89% and a MOTA of 95.79%. Compared to Top-K selection, our algorithm also increases visual diversity by 146%, temporal coverage by 89%, and information retrievability by 3.5%.

Comments21 pages, 3 figures

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑