arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

浙江大学、蚂蚁等提出4DAnyone,一段随手拍视频重建动态人物

arXiv 2608.20335 cs · cs.CV

用手机随手拍一段人物视频,想得到能从任意方向观看的动态模型,单目画面缺少背面与侧面信息。浙江大学、蚂蚁集团、香港中文大学、香港科技大学等机构提出4DAnyone,先生成多视角一致视频,再把它提升为4D高斯泼溅表示。

方法针对多视角视频生成的上下文瓶颈:参考视角不断增加会稀释外观条件,不同目标组又无法直接交换信息。4DAnyone用参考上下文打包将相关复杂度从O(N)固定到O(1),并在去噪过程中轮换目标视角分组。

4D重建需要的不只是几张新视角图片

静态3D重建只需让各视角描述同一个物体。动态人物还要求动作、衣服褶皱、头发和身体形状随时间一致。某个视角若把手臂位置画错,4D高斯拟合后会出现重影或结构漂移。

相机控制视频扩散模型可以从给定视频合成新视角,但4D重建通常需要数十个目标方向,超过一次Transformer前向能处理的上下文。直接分批生成后,各批看不到彼此,人物外观和几何会逐渐分叉。

4DAnyone从野外单目视频构建多视角动态人物

论文源码示例将同一人物动作扩展到多个目标视角。

4DAnyone把视频生成当作重建前的补全器。生成结果必须服务于后续几何优化,因此重点是跨视角可用性,而不只是单个视频看起来真实。

固定长度保存参考,轮换分组传递结构

Reference Context Packing把不断增长的参考视角压入固定长度、混合分辨率的上下文。模型保留关键全局外观和局部细节,不让参考Token随视角数量线性增长,从而把参考侧复杂度保持在O(1)。

Target Context Routing负责目标侧。高噪声阶段轮换视角分组,让原本分开的目标方向间接共享全局结构;低噪声阶段减少轮换,集中稳定纹理和细节。前者防止身体比例随批次漂移,后者避免频繁交换破坏局部清晰度。

项目页展示的目标视角渲染帧

同一输入动作可在新相机方向下渲染,供后续4DGS重建使用。

这种路由不是把全部视角一次塞进模型,而是在有限上下文预算内安排信息交换。计算量仍随生成视角和帧数增加,O(1)只描述参考上下文长度。

从多视角视频提升为4D高斯表示

生成的视角序列进入4D Gaussian Splatting流程。空间中的高斯点携带位置、颜色、尺度和时间变化,渲染时可从新相机观察动态人物。相比只保存若干视频,4D表示支持连续视角移动。

团队构建MVGameHuman数据集,用自研游戏引擎生成可控人物与相机轨迹,并结合灯光舞台和野外视频训练。实验在DNA-Rendering和DyMVHumans上比较新视角视频质量与下游4DGS重建,论文报告两方面均优于对照方法。

项目页中的野外人物重建案例一

野外短视频示例用于检查非实验室背景下的人物外观保持。

这些数据集覆盖的服装、动作和遮挡仍有限。宽松衣物、多人交互、快速旋转或长时间完全遮挡,会给单目补全带来更强歧义。

应用与下一步:面向数字人采集与动态内容制作

4DAnyone降低了动态人物采集对多相机阵列的依赖。短视频创作者、虚拟试衣和游戏角色原型可以先用普通单目素材获取可旋转结果,再由编辑人员修正不稳定区域。

项目页中的野外人物重建案例二

不同人物和动作展示了方法对普通拍摄素材的适配范围。

下一步需要加入可量化的身份、服装与几何一致性检查。视频看起来连贯,仍可能在背面生成错误纹理;产品流程还要处理肖像授权、素材版权和可删除性。

论文证明单目视频可以作为4D重建入口,但没有把研究结果等同于一键商用扫描。拍摄分辨率、运动模糊、视角覆盖和光照变化都会决定最终模型是否可用。

面向制作流程,还要保留输入帧、合成视角和最终高斯点之间的映射。编辑人员发现背面纹理或手部结构错误时,才能定位对应生成批次并局部重算,而不是重新处理整段视频。这样的可追溯编辑能力比单次演示画质更接近生产需求。

参考资料

https://arxiv.org/abs/2608.20335

https://4danyone.github.io