arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频里手被挡住也能追踪,南洋理工等提出DreamHand,误差最高降61%

arXiv 2608.20308 cs · cs.CV

第一人称视频中,手经常被物体挡住,甚至短暂伸出画面。南洋理工大学、香港中文大学、上海交通大学、ACE Robotics等机构提出DreamHand,把视频扩散模型当作确定性几何编码器,用完整片段恢复连续双手3D轨迹。

在五个第一人称基准上,DreamHand在遮挡较多的ARCTIC将MPJPE-p降低30%,在HOT3D降低40%;把出画手部也纳入评价后,相对提升达到46%至61%。方法不依赖额外手部检测器,还提供无需测试时相机内参的配置。

单帧看不见的手,前后画面可能留下线索

传统手部姿态方法逐帧处理,当前帧没有手就很难输出。滑动窗口模型能利用短时间上下文,但手一旦离开窗口或长时间被物体遮挡,轨迹容易中断。第一人称操作恰好频繁出现这种情况:拿杯子时手指被杯体挡住,开柜门时手伸到视野边缘。

DreamHand改为离线片段级处理。模型可以同时读取遮挡前后的画面,根据物体运动、手臂方向和再次出现的位置,恢复中间轨迹。它不是凭单帧“看穿”物体,而是利用完整视频中的时序证据。

DreamHand在手短暂出画时仍连接左右手轨迹

论文示例中,黄色框标出手离开画面的时段,恢复轨迹仍保持连续。

这种离线设定适合整理训练数据、动作分析和视频标注,但不能直接视为低延迟在线控制。机器人若要边看边动作,无法提前读取未来帧,还需要另行设计因果版本。

把视频扩散模型从渲染器改成编码器

视频扩散模型通常从噪声开始,多步采样生成像素,计算重且带随机性。DreamHand不走完整生成流程,而是把干净视频片段编码到潜空间,只做一次确定性前向传播,提取包含场景和时序信息的特征。

随后,双向时空解码器在整个片段中交换信息,同时估计左右手姿态、全局方向、关节和度量位置。双向结构允许后面的可见帧帮助前面的遮挡时刻,避免轨迹在缺失区间各自漂移。

DreamHand由干净潜变量编码器和双向时空解码器组成

方法将预训练视频扩散网络用于特征提取,再解码连续双手几何。

相机参数会影响从图像坐标恢复真实尺度。DreamHand的标准配置使用内参;第二种配置加入基于射线的相机求解器,在测试时无需提供内参。两个配置的适用条件和精度不同,不能把“无需内参”理解为完全不需要相机几何。

遮挡越严重,完整片段带来的收益越明显

论文在ARCTIC、HOT3D等五个基准比较方法,指标覆盖3D姿态、关节、全局方向、二维投影和时间稳定性。ARCTIC与HOT3D中遮挡更频繁,DreamHand的MPJPE-p分别下降30%和40%。

当评价不再忽略出画手部,收益扩大到46%至61%。这组结果说明,过去只在“当前能看见手”的帧上计分,会低估完整轨迹恢复的实际差异。对机器人数据整理而言,出画区间往往正连接两个关键动作。

不同方法在遮挡片段上的3D手部恢复对比

可视化对比检查模型在物体遮挡和视野缺失时能否保持手部几何连续。

这些提升是相对论文基线的误差降幅,并不表示所有关节都达到毫米级可靠。数据集标注、相机运动和长片段长度都会影响最终轨迹。

应用与下一步:从人类视频补充机器人数据

连续3D手轨迹可以把普通第一人称视频转成更结构化的操作数据:什么时候接近物体、双手如何协作、抓取后沿什么路径移动,都比单纯RGB帧更容易映射到机器人策略。

论文把恢复的人手运动映射到机器人操作分析

论文示例展示连续手部轨迹作为机器人操作数据的使用方向。

下一步需要把离线恢复与物体姿态、接触状态和力信息结合。仅知道手在哪里,仍不足以判断是否真正抓住物体;不同机械手的自由度也需要动作重定向。

DreamHand当前是一套研究框架。它为大规模视频预处理提供了路径,真正进入机器人学习流水线后,还要测量恢复误差如何传递到策略成功率,并区分视觉上连贯的轨迹与物理上可执行的动作。

参考资料

https://arxiv.org/abs/2608.20308

https://ggxxii.github.io/dreamhand/