arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

反光点乱成一团也能还原动作,浙大团队把中国功夫做成3D数据

作者:arXivDaily编辑部 arXiv 2609.19927 cs · cs.CV

论文导读

浙江大学、西湖大学、复旦大学和南京大学团队提出DirtyMoCap,直接处理稀疏、无序、会丢失也会冒出异常点的光学动捕数据。单一模型可适配不同标记布局,自定义CUDA求解器相对标准PyTorch实现最高加速100倍,并把传统中国武术录制恢复成连贯SMPL-H人体动作。

实验室里贴得整齐,真实数据里却经常乱套

传统光学动作捕捉要求在人体固定位置贴反光点,再用多台相机追踪。理想数据中,每个点都有身份且轨迹连续;真实录制会出现遮挡、反射干扰、标记脱落与编号交换,点的数量和布局甚至会在不同项目间变化。

许多方法为一套固定标记布局训练,换一次贴点方案就要重新适配。DirtyMoCap不先猜每个原始点对应身体哪一处,而是把无序观察映射到一组稳定的“代理锚点”,包括骨骼关节和身体表面点。

图1:论文主图展示多种标记布局和污染形式,以及恢复后的连续人体动作。

先把点云变成锚点,再拟合人体模型

第一帧建立代理锚点,滑动窗口网络随后追踪长序列中的锚点轨迹。模型同时观察原始标记和上一时刻状态,补偿短时缺失并降低异常点影响。锚点提供固定中间表示,后端不再依赖输入标记的顺序和数量。

随后,一个可微Gauss-Newton求解器把锚点拟合到SMPL-H人体模型,恢复全身姿态、位移和体型。网络会学习观测置信度、时间平滑和姿态先验权重:某个标记突然跳走时,求解器可以降低它的可信度,而不是把人体一起拉变形。

图2:项目方法图分为锚点初始化、轨迹预测和可学习人体求解三段。

一个模型跨布局,求解器最高快100倍

实验覆盖多种标记数量、布局、噪声、丢点和异常点。论文报告,DirtyMoCap在关节与网格顶点重建误差上持续优于需要特定配置的基线,并且只训练一个模型就能处理不同布局。自定义CUDA求解器相对标准PyTorch实现最高加速100倍。

图3:论文展示人体表面代理锚点如何为无序点云建立稳定的身体中心表示。

结果图还比较了不同动作片段中的人体重建。标题里的能力只针对光学反光点输入,不是从普通单目视频恢复动作;最高100倍也对应论文指定的求解器实现和硬件比较。

图4:论文结果图展示多个姿态序列的重建人体。

下一步让老动捕数据跨设备复用

团队把方法用于不同来源的传统中国武术光学动捕,得到时间连贯的SMPL-H数据。统一人体参数便于动作检索、动画重定向和训练生成模型,也让过去因贴点方案不同而难合并的录制有机会重新整理。下一步要处理宽松服装、多人接触和器械遮挡,并公开更多原始点与恢复结果,检验跨设备、跨场地的稳定性。

参考资料

https://arxiv.org/abs/2609.19927

https://arxiv.org/html/2609.19927

https://wanglongzju.github.io/DirtyMoCap-Project-Page/