论文导读
腾讯、北京大学、香港科技大学等机构提出FlowHMR,从普通单目视频恢复三维人体动作,再通过物理控制器检查动作能否被稳定追踪。在4182段网络视频评测中,仿真追踪成功率达到82.47%,GVHMR对照为62.82%。恢复出来的动作兼顾视频中的姿态与物理执行,为动画和运动数据制作提供可检查的输出。
视频里像,落到3D里还要站得住
一个人在视频中抬腿、转身或撑地,画面没有直接给出每个关节离镜头多远。同样的二维姿态可能对应不同三维动作,直接预测一个平均答案,容易丢掉动作中的细节。
另外,视觉上贴近原视频的动作,不一定能在物理环境中稳定执行。脚穿进地面、身体漂浮、支撑关系不合理,都可能让控制器无法继续跟踪。FlowHMR把这两类要求放进同一个动作恢复流程。
它恢复的是全局三维人体运动,既包括姿态,也包括人在场景中的移动。输入仍为单目视频,没有把多机位动作捕捉设备作为运行时前提。
图:踢球输入视频与不同方法恢复动作、仿真追踪的对比。
先生成动作,再奖励贴近视频和可追踪
团队先训练一个由视频引导的动作生成模型,为同一个输入保留多种合理动作的可能性。随后使用两类奖励进行后续训练:一类检查恢复动作是否忠实于视频,另一类检查物理控制器能否追踪。
物理奖励不是在输出后简单删掉不合格动作。它参与改变模型的生成偏好,让模型更常输出既对得上画面、又能在模拟环境中执行的动作。这样处理单目深度歧义,比一开始只回归一条轨迹更有余地。
论文同时准备了Wild-4K评测集,覆盖约4000段不同姿态和场景的网络视频,用来检查方法离开传统动作数据集后的表现。
图:生成式预训练与视频一致性、物理追踪奖励的训练流程。
4182段视频,仿真追踪成功率82.47%
在Wild-4K的4182段视频上,FlowHMR使用PHC+物理控制器获得82.47%的追踪成功率,GVHMR为62.82%。没有后续奖励训练的版本已经达到78.79%,加入奖励进一步改善了物理追踪和穿地、漂浮问题。
这里的成功率指控制器在仿真中跟上恢复动作,不能写成人形机器人实机完成动作的概率。脚部滑动指标也并非全部最优:最终版本为2.17,GVHMR为1.59,不同物理质量维度仍有取舍。
RICH数据集的185段序列提供了另一组检验。FlowHMR的PHC+执行成功率为51.35%,GVHMR为28.11%。不同数据集的分布和评测难度不同,82.47%不能当成任意视频输入的保证。
下一步:动作数据进入动画和机器人模拟
项目演示展示了动作恢复、物理追踪和应用过程。把恢复动作转换到宇树G1,再用SONIC在Isaac Lab中追踪,是机器人动作数据使用方向的一项模拟展示。它与真实机器人落地之间还有控制、硬件和安全验证。
动画制作可以检查恢复动作是否忠实于镜头,并使用物理追踪结果排查支撑和接触问题。继续扩大动作范围、处理遮挡和复杂交互,是提升这些输出实用性的下一步。代码与模型检查点可从论文所列仓库核查。
图:输入视频、恢复动作与宇树G1在模拟器中的追踪画面。
参考资料
https://arxiv.org/abs/2610.03691