论文导读
英伟达团队提出SoL-Refiner,把低分辨率视频升级到4K所需的扩散精修压缩为一次去噪。它在约2K设置中同时领先多种外部精修器,并凭完整加速栈把相对三步基线的精修延迟缩短到原来的约九分之一。
高分辨率生成卡在第二遍
直接生成高分辨率视频会让时空Token数量快速增长。工程上常先产出较小视频,再用精修器补细节和放大;但传统精修器还要走多次扩散采样,相当于主模型之后又排一次长队。SoL-Refiner把这一步压成单次去噪,目标是在不牺牲质感的前提下降低等待时间。
图:同一猫视频对比低质输入、无强化版本和完整精修结果。
训练分三段:先用高分辨率数据持续训练,再通过强化学习偏向更好的视觉结果,最后把多步能力蒸馏到一步模型。一次前向并不意味着简单锐化,它仍利用生成模型恢复纹理、边缘和运动一致性。
同一输入比较才公平
团队构建Refiner-Bench,收集不同视频生成器的输出,并让各精修器处理同一批输入,在约2K分辨率下比较。这样能减少上游视频差异对成绩的干扰,把问题聚焦在精修阶段本身。
图:视觉结果与延迟曲线并列展示一步精修的质量速度取舍。
定性样例中,同一只猫在低质量输入、无强化学习版本和完整版本之间呈现毛发、轮廓与时间稳定性的变化。强化学习负责改善人眼关注的质量,蒸馏则把这一能力压缩到一步。
8.91倍属于2K延迟设置
在2K比较中,一步SoL-Refiner在VBench和UniPercept平均指标上超过论文纳入的外部精修器;在3840×2176输出上,两项指标也优于三步LTX-2.3 Refiner。完整加速栈在论文的2K延迟设置中获得8.91倍加速。
图:柱状结果比较模型在多种输出分辨率下的指标表现。
标题把4K能力和8.91倍速度放在一起,但二者来自不同实验侧面:4K实验主要验证质量,8.91倍对应2K延迟协议。实际速度还会受帧数、显卡、上游模型和编解码影响。
未来一步精修打开实时工作流
更短延迟适合预览、广告素材迭代和交互式视频编辑:创作者可以先快速生成构图,再把选中的片段升级到高分辨率。服务端也能减少扩散步数带来的排队和能耗,把算力留给更多候选。
下一步要测试字幕、小脸、快速运动和压缩噪声,并同时报告单帧缺陷与跨帧闪烁。若系统能根据输入难度在一步和多步之间自动切换,高质量片段可走快速路径,复杂片段则保留更稳妥的精修预算。实际产品还需计入解码、传输和存储时间,才能确认用户端等待是否同步下降。对创作者还应保留原始低清片段和精修参数,方便发现细节被错误补全时快速回退,并比较不同版本。