arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

镜头没拍到的地方也能补:复旦PASTEL把4D场景再推高0.9 dB

作者:arXivDaily编辑部 arXiv 2609.06099 cs · cs.CV

论文导读

复旦大学、华为中央媒体技术研究院联合提出PASTEL,把单目视频已拍到的区域做4D重建,再用生成先验补出相机视野之外的合理内容。它把复杂的新视角搜索压到全景空间中的二维方向规划,并在DyCheck iPhone数据集上把全图PSNR比此前最佳方法提高0.9 dB。镜头外内容是模型生成的合理补全,不是真实不可见区域的恢复。

传统4D重建走不出原相机视野

4D场景重建要同时恢复三维空间和随时间变化的人或物。用手机随手拍的一段单目视频,现有方法能在原镜头覆盖范围内合成新视角;一旦相机移动到从未拍到的方向,模型没有观测,画面就会出现空洞、拉伸或模糊。

PASTEL把任务分成两部分:可见区域继续由重建方法负责,越过原视野边界的区域交给生成模型补全。它并不声称猜中了真实房间或物体背面,而是要求新内容在相邻视角之间连贯,并和已观测区域自然衔接。

图1:论文Figure 1展示从单目视频选择镜头外轨迹,并比较动态物体在扩展视角中的重建结果。

把六自由度搜索摊成全景方向图

直接在三维空间搜索相机位置和朝向,需要处理六个自由度,候选轨迹很快爆炸。PASTEL先把各帧投影到统一全景空间,显式标出哪些方向已被观察、哪些方向越过边界。随后只在二维方向上挑选轨迹起点和扩展方向,尽量探索新区域,同时避免相机一步跳得太远。

图2:论文Figure 2展示全景对齐、相机插值、轨迹扩展、扩散先验细化和策略监督的处理顺序。

沿轨迹得到的静态与动态场景先进入生成先验细化,再与高斯泼溅的渲染结果比较。系统找出不可靠和不可见区域,把这些位置作为重点监督对象;已观测区域则承担锚点,防止生成内容把原视频里的物体和动作改掉。

全图PSNR提高0.9 dB,提升来自视野外区域

在DyCheck iPhone数据集上,PASTEL的全图PSNR比此前最佳方法高0.9 dB。论文的定性对比覆盖搬动物体、动态人物和大幅相机位移,框出的区域集中在原镜头共视范围之外。方法既补全背景,也处理运动物体暴露出的遮挡区域。

图3:论文Figure 3并排比较输入、真实参考及多种4D重建方法,黄色框标出超出共同可见范围的区域。

PSNR需要有参考图像才能计算,0.9 dB来自有真实后续视角的基准,不表示任意拍摄都能验证镜头外补全。生成模型可能给出视觉上合理但事实错误的纹理或物体,因此这类输出适合视图扩展和内容创作,不能当作取证或精确测量。

下一步:VR与机器人使用前要标清生成区域

PASTEL可用于把短视频扩展成更宽的自由视点片段,为VR内容、数字人和仿真场景提供初始化。下一步应让系统输出逐像素的可见性与生成置信度,明确哪些区域来自原始观测、哪些是模型补全。机器人若使用这类场景规划路径,还必须用新传感器观测确认障碍物,不能依靠生成区域直接行动。对内容工具而言,可编辑生成边界和跨时间一致性会比单帧画质更决定使用价值。

参考资料

https://arxiv.org/abs/2609.06099

https://arxiv.org/html/2609.06099