arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.14706cs.CVcs.AIcs.LG

均衡强迫:无需噪声条件的自适应视频生成

Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning

  • UC San Diego(加州大学圣地亚哥分校)
  • MIT(麻省理工学院)
  • Harvard University(哈佛大学)

机构由 AI 辅助整理,请以论文原文为准。

Hansen Jin Lillemark, Alex Rojas, Zachary Novack, Runqian Wang, Yilun Du, Yian Ma, Taylor Berg-Kirkpatrick, Rose Yu

AI总结:

该研究提出无需噪声条件的均衡强迫(EqF)框架,解耦去噪场学习与采样,实现自适应闭环推理,提升自回归视频生成的质量与一致性,性能优于传统噪声条件方法。

AI中文摘要:

基于扩散模型和流匹配的标准自回归视频生成算法依赖于固定的训练目标和静态采样调度,限制了推理过程对数据的适应性。我们提出均衡强迫(Equilibrium Forcing, EqF),这是一种用于视频去噪生成模型的简化框架,无需噪声水平条件。EqF 开创了噪声无条件生成的模块化训练和推理时间设计,将去噪场的学习与采样解耦。这种灵活性支持在推理时运行闭环算法,通过适应样本反馈来操作,在具有挑战性的自回归视频生成基准上提高了视频质量和一致性。广泛的分析阐明了去除噪声水平条件如何使 EqF 依赖数据的推理特性超越标准噪声水平条件去噪视频方法的性能。

英文摘要:

Standard autoregressive video generation algorithms based on Diffusion and Flow Matching rely on rigid training objectives and static sampling schedules, limiting inference procedures from adapting to the data. We introduce Equilibrium Forcing (EqF), a simplified framework for video denoising generative models without noise level conditioning. EqF pioneers modular training- and inference-time designs for noise-unconditional generation that decouple learning the denoising field from sampling. This flexibility allows for inference-time algorithms that operate in a closed loop by adapting to feedback from the sample, improving video quality and consistency on challenging autoregressive video generation benchmarks. Extensive analysis elucidates exactly how removing the noise level conditioning enables EqF's data-dependent inference properties to surpass the performance of standard noise level-conditional denoising video methods.

补充信息

↑