JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
AI总结:
研究针对实时视频编辑的低延迟、时序一致等需求,提出160亿参数的JoyAI-Video-Edit自回归扩散框架,结合多种蒸馏技术,在单张Nvidia B200 GPU上实现约30 FPS的720p视频编辑,性能优于现有流式编辑器且与离线系统相当。
AI中文摘要:
实时视频编辑需要在有限计算资源下实现低延迟因果生成,同时保留源保真度与长期时序一致性。本文提出JoyAI-Video-Edit,这是一个拥有160亿参数的自回归扩散框架,可在无法获取未来帧或预定义视频时长的情况下实现实时开放式视频编辑。该方法结合分块自回归适配、源锚定分布匹配蒸馏(SA-DMD)以及长时序自回归蒸馏,以减少训练-推理不匹配、在两步生成中保留源保真度并缓解累积时序漂移。大量自动与人工评估表明,JoyAI-Video-Edit在长短视频上均显著优于现有流式编辑器,且与强大的离线系统具有竞争力。完整系统在单张Nvidia B200 GPU上可实现约30 FPS的720p视频端到端编辑。代码可在指定URL获取。
英文摘要:
Real-time video editing requires low-latency causal generation with bounded computational resources while preserving source fidelity and long-term temporal consistency. We present JoyAI-Video-Edit, a 16B-parameter autoregressive diffusion framework for real-time, open-ended video editing without access to future frames or a predefined video duration. Our method combines chunk-wise autoregressive adaptation, Source-Anchored Distribution Matching Distillation (SA-DMD), and Long-Horizon Autoregressive Distillation to reduce train--inference mismatch, preserve source fidelity during two-step generation, and mitigate accumulated temporal drift. Extensive automatic and human evaluations show that JoyAI-Video-Edit substantially outperforms existing streaming editors and remains competitive with strong offline systems on both short and long videos. The complete system achieves end-to-end 720p video editing at approximately 30 FPS on a single Nvidia B200 GPU. Code is available at https://github.com/jd-opensource/JoyAI-Video-Edit.