Snap和KAUST的研究团队推出了EgoPlay,一个事件触发的第一人称视频编辑器。给它一段单目视频和一条「当X发生时,做Y」的指令,它自己判断事件X是否发生、何时发生,事件前的帧原样保留,编辑只作用于事件后的画面。该工作被SIGGRAPH Asia 2026接收,在Ego4D基准上相对此前的最优方法EgoEdit,编辑质量、视觉质量和背景一致性三项分别取得17.7%、16.9%和16.4%的相对提升。
「等事情发生了再动手」
第一人称视频的编辑指令往往带一个时间条件:当我翻手掌时加个火球,当我放下杯子时换个背景。现有系统通常把它拆成两步——先跑一个事件检测器找到时间点,再调一个视频编辑器处理后半段。这种级联的问题在于误差叠加:检测器晚半秒,编辑就落错位置;两个模型对画面的理解不一致,接缝处就会穿帮。
EgoPlay把事件识别、时机克制和像素级编辑放进一个端到端模型联合学习。训练数据主要来自Ego4D,团队构造了事件条件化的配对数据。模型同时支持否定指令(「当X不发生时」)和多事件指令。
架构上,EgoPlay在一个预训练的视频到视频扩散Transformer上微调,提供双向和因果两种变体。双向版本用完整注意力看全片,因果版本用因果注意力,后者是唯一可流式处理的变体,显存从45.96GB降到41.87GB。
图:EgoPlay的双向与因果两种架构。因果变体以因果注意力处理视频块,支持流式生成(论文Figure 3)。
数据怎么造
事件触发的编辑需要「事件前不变、事件后编辑」的成对数据,现实视频没有这种标注。团队的管线是反向构造:先从Ego4D筛选视频片段,按美学、模糊、运动、亮度等一组阈值过滤,再用视频生成模型对事件后的帧做重绘,得到编辑后的目标版本,事件前的帧保持原样作为约束。
图:事件条件化训练数据的构造管线。视频标注、事件切分与重绘组合成「事件前保持、事件后编辑」的配对样本(论文Figure 2)。
指标对比:赢在时机和记忆
和EgoEdit、VLM引导的检测加编辑级联两个基线比,EgoPlay在Ego4D基准上全面领先:对EgoEdit的相对提升为编辑质量17.7%、视觉质量16.9%、背景一致性16.4%;对级联基线为15.7%、14.5%、13.5%,而且显存占用不到对方一半。事件起点定位上,在最严格的Acc@0.1容差下,EgoPlay拿到45.5,高于级联基线的40.0——它对「事件到底哪一刻发生」的判断更准。
长时序是另一个亮点。超出训练时域后,时序一致性保持在0.743到0.752之间基本持平;全片VLM得分7.76,高于五秒前缀的7.39,说明拉长时间没有明显掉质量。
图:与基线方法的对比示例。给定同一事件指令,EgoPlay的编辑时机与画面质量优于级联方案(论文Figure 4)。
指令怎么下
几种指令类型的演示里,空间定位和时间定位可以分开指定:「把左边的办公椅换成盆栽」是空间编辑,「当我翻手掌时加个火球」是时间编辑。模型对否定式和多事件指令同样有效。人评中,EgoPlay对每个基线的综合胜率都显著超过50%的随机线;唯一打平的是对自家因果变体的编辑质量项。
图:EgoPlay的多样编辑示例,覆盖空间定位、时间定位与组合指令(论文Figure 1)。
从特效扩展到第一人称内容生产
第一人称视频是AR眼镜和运动相机的原生内容,量极大但几乎没人剪。EgoPlay这类事件触发编辑把剪辑门槛压到一句话,对创作者是个直接可用的工具;对Snap,它也是AR特效生成的同源技术。
边界同样清楚:扩散模型的编辑质量依赖生成模型的先验,极端光照和快速晃动下仍有瑕疵;因果变体可流式但编辑精度略低于双向版。团队在论文里把「检测加编辑一体化」的路线验证通了,下一步是更长的视频流和更复杂的多事件编排。