把厨房角落的第三人称录像改成操作者头戴相机视角,镜头旋转幅度可能超过普通新视角合成的范围,身体和台面还会遮住大量区域。NVIDIA提出Grounded-Exo2Ego,从单段外部视频重建场景几何,再用物体级语义补全第一人称镜头中原视频看不到的内容。
模型在EgoExo4D基准上按论文报告的全部指标超过近期对比方法。生成结果依靠扩散模型推断遮挡区,并非从视频中恢复真实像素;“补全”代表视觉上合理且受场景约束,不保证与当时真实第一视角完全一致。
极端视角让纯几何条件出现大片空洞
常见方案先从单目视频重建3D,再把重建结果渲染到新相机位置,作为视频生成条件。外部镜头看不到操作者面前的台面细节,单目几何本身也有缺口。渲染到头部位置后,空洞、漂浮结构和错误深度会被扩散模型继续放大。
项目页方法图:几何锚定分支提供结构,语义分支按物体区域补充上下文。
Grounded-Exo2Ego采用双分支。几何锚定分支读取带颜色和深度的3D重建;语义分支提取物体分割掩码和物体Token,把掩码重新投影到第一人称视角,限制跨注意力只在相应区域调用相关物体信息。
相机重定位先修正训练对不齐的问题
EgoExo4D同时有外部与头戴录像,但重建坐标中的相机和真实头戴相机并不会天然严格对齐。论文发现,这个被忽视的误差会让训练目标错位,因此加入相机重定位算法,在学习生成模型前先对齐两套轨迹。消融实验显示,重定位对各项质量指标都有提升。
项目页数据引擎:带骨骼角色在程序化环境中同时生成外部视角、第一视角和深度。
真实成对数据有限,团队还搭建自动合成引擎,在程序化环境里放置可绑定骨骼的3D角色,同时渲染外部视频、第一人称视频、深度和相机轨迹。合成数据提供准确几何和成对视角,真实数据负责补足外观与动作分布。
物体语义专门处理看不见的区域
项目页主图:输入外部视频,经语义3D重建后与Vista4D、EgoX和真值比较。
定性案例中,纯几何方法在头戴视角出现空洞或扭曲,语义分支可以根据“盘子、砧板、容器”等对象上下文生成更完整画面。论文在FVD、感知距离和图像相似度等指标上报告大幅领先,并分别验证几何分支、语义分支、重定位和合成数据的作用。
这些指标衡量生成分布和参考视频的接近程度,不能证明每个被遮挡物体的位置都准确。第一视角内容用于训练机器人或AR系统时,还需评估动作接触点和空间关系,而不只是画面观感。
语义掩码带来更强约束,也把上游分割错误传给生成器。若把杯子误分成盘子,物体Token会在错误区域提供错误上下文。论文的受控数据已有较完整分割,野外视频中的长尾物体和快速形变仍需要单独测试。
双分支还要维持时间一致性。某一帧补出合理物体并不够,连续视频里其位置、纹理和遮挡关系都要稳定。作者用视频级指标评估整体质量,但面向长序列还需报告身份漂移和几何抖动随时间累积的程度。
下一步进入AR、机器人与视频再利用
论文野外示例:方法也测试了非标准采集条件下的第三人称输入。
作者面向AR/VR和物理AI提出该任务。外部录像若能转换为近似头戴视角,可扩充第一人称动作数据、预览AR内容或为机器人提供人类操作参考。下一步需要在更快相机运动、多人遮挡、室外场景和长视频中检验一致性,并把生成质量与下游操作成功率直接连接起来。
训练数据扩充也要区分合成与真实分布。程序化角色能提供精确相机和深度,却难以覆盖衣物、手指和厨房杂物的全部细节。扩大合成规模之前,需要观察真实测试集是否继续受益,而不是只提升合成场景指标。
参考资料
https://arxiv.org/abs/2608.20534
https://arxiv.org/pdf/2608.20534
https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/