arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

北大、腾讯混元提出4DStreamCtrl,单卡20 FPS实时控制视频镜头和物体

作者:arXivDaily编辑部 arXiv 2608.25479 cs · cs.AI · cs.CV

拖动一个物体的三维轨迹、改变相机运动,再让视频继续往后生成,过去通常要分给不同模型处理。北京大学、腾讯混元提出4DStreamCtrl,把相机、物体和深度都编码成三维点轨迹,在一次前向计算中完成联合控制。

经过因果流式蒸馏后,模型用四步去噪在单张高端GPU上生成480p视频,速度达到20 FPS,显存占用不随视频长度线性增长。论文展示了数百帧连续结果,但这是一套研究系统,并不等于腾讯已有面向用户的实时视频产品。

三维点轨迹统一镜头、物体和遮挡

二维轨迹只能告诉模型物体在画面平面上往哪里走,无法表达靠近镜头、被前景遮挡或相机绕行。相机参数控制又只能改视角,不能单独推动杯子、汽车或人物。4DStreamCtrl把视频中的点写成随时间变化的三维坐标,并同时保留深度与相机投影关系。

项目页总览:模型覆盖运动迁移、镜头与物体联合控制、深度编辑和长视频流式生成。

输入可以是相机路径、目标物体的三维轨迹,也可以是另一段视频提取出的运动。轻量几何运动头把这些控制转换成扩散模型可读取的条件,原有视频生成主干负责补充纹理、光照和未显式指定的背景变化。

同一表示还能做深度编辑:用户改变目标点的三维位置后,模型依据投影关系更新画面位置与遮挡,而不只把二维像素平移。论文把这些能力放进同一个模型比较,避免为相机、对象和运动迁移各维护一套互不兼容的控制接口。

从野外视频挖出三维运动监督

大规模视频普遍没有精确相机与物体三维轨迹。团队构建OpenVidHD-Motion3D,从普通视频估计深度、相机和点运动,再筛除不可靠轨迹。这样既保留真实世界外观,也为联合控制提供统一监督。

论文源码长视频样例:流式序列的起始帧,作为后续运动与一致性比较的参照。

几何运动头采用时间可分离结构,每一段只依赖过去状态,因此能转成因果学生模型。离线教师先学习完整时段中的控制关系,学生再蒸馏到只看历史的流式生成,避免每来一帧都重算整段视频。

四步去噪把控制推到实时速度

扩散视频模型通常需要多轮去噪,画面越长,缓存的中间特征越多。4DStreamCtrl将学生压到四步去噪,并让状态按时间滚动更新。论文报告单张高端GPU上480p达到20 FPS,且内存需求与总时长解耦。

论文源码受控样例:人物将蛋糕上层移动到夹心上方,展示物体运动生成。

实验分别比较相机控制、二维轨迹和离线三维控制方法。作者报告新方法在运动控制精度上领先,并覆盖其他方法只能单独处理的控制类型。速度数字依赖论文硬件、480p分辨率和四步设置,提升分辨率或换消费级显卡会改变帧率。

从演示走向交互系统还缺输入闭环

数百帧序列中,模型能延续场景结构和受控运动,说明因果缓存没有立刻积累成明显漂移。长视频仍可能出现身份、几何或细节逐步变化,论文中的连续样例不能替代大规模人工稳定性评测。

论文源码轨迹控制样例:人物在户外场景中按输入运动抬手。

下一步更接近产品的测试,是把游戏手柄、机器人状态或用户鼠标轨迹实时接入,并测量输入到画面响应的总延迟。若系统要作为机器人世界模型,还要让生成结果反过来接收新观测并纠正状态,而不只是按预先给定轨迹向前播放。

实时系统还要报告最坏帧率,而不只是平均20 FPS。控制输入突然改变时,四步去噪能否在下一帧响应、连续运行数分钟后显存是否稳定、不同画面内容会不会触发速度波动,都会直接影响交互体验。论文现有结果证明了研究原型的速度与控制范围,尚未覆盖这些产品级压力测试。

参考资料

https://arxiv.org/abs/2608.25479

https://arxiv.org/html/2608.25479

https://4dstreamctrl.github.io/