arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

OPPO、港理工把画图模型一分为二,峰值显存最多省48.36%

作者:arXivDaily编辑部 arXiv 2610.08070 cs · cs.CV

论文导读

香港理工大学、OPPO研究院提出PVD,让两个半尺寸专家接力完成画图:前段确定结构,后段补细节。两段累计计算接近原始骨干的一次前向计算,三种文生图模型的峰值显存减少45.76%至48.36%。论文同时展示了猫、花束、咖啡与风景等生成对照,检查加速后能保留多少画面质量。

少走几步,画面细节别一起丢

扩散画图通常需要多次计算,逐渐把噪声变成完整图片。减少生成步骤可以加速,但把整个过程压进一个模型的一次映射,经常让画面显得过于平滑。结构布局和精细纹理需要做的工作并不相同。

PVD把生成时间分为前后两个阶段。早期专家负责较粗的结构构成,晚期专家负责进一步细化,每个专家约为原骨干的一半大小。它们依次运行,累计计算量接近一次完整骨干前向,而非两个完整大模型各跑一遍。

这里的“一次计算预算”指计算量归一化后的比较,不等于只调用一次网络。两个专家接力仍有先后顺序,实际耗时也要看实现和硬件。

图:两种整段学习路线与分阶段学习路线对照,右侧标出两个半尺寸专家。

先学大模型,再各管一段生成

团队从较大的教师模型提取半尺寸骨干,先让小模型学习教师怎样改变画面,再分别训练两个阶段的专家。文生图版本还针对各阶段加入细化训练,改善生成结果与参考分布之间的差距。

研究在Stable Diffusion 3.5-Medium、FLUX.1-dev和Qwen-Image上验证这一拆分。不同骨干采用不同专家实现,但共同点是把结构与细节对应的计算分开,让每段学习更明确的变化。

论文对比了教师、PVD与其他加速方法的图片。猫的毛发、花束、招牌文字和街景提供了不同难度的案例,不能只凭一张漂亮示例判断所有提示词都能保住效果。

图:从教师提取小骨干,再进行分阶段训练和文生图细化的流程。

显存近半,速度和质量还要分开看

三种文生图骨干的峰值显存分别从4.99降至2.67GiB、22.64降至12.28GiB、38.42降至19.84GiB,对应减少46.49%、45.76%和48.36%。激活参数减少约49.10%至50.89%,但两个阶段合计的总参数与单阶段激活参数不同。

在ImageNet的256×256类条件生成中,PVD的FID为1.48,低于被测加速方法iMF的1.72和FACM的1.76。FID衡量生成与参考图像分布的差距,不能写成单张图片的画质分或正确率。

文生图各项测试并非全都超过教师。Qwen-Image的GenEval由0.8720变为0.8846,但Qwen-Image-Bench综合分由48.78变为46.85。这说明加速保留了很多能力,也需要按具体任务看质量变化,不能用一个指标宣布全面超过大模型。

猫、花束和街头文字的定性对照分别显示不同模型的输出,它们是局部样例,不能单独代表整套测试的平均表现。

图:猫、花束、店面招牌和涂鸦的教师及多种加速模型生成对照。

把阶段分工变成更细的部署选择

峰值显存下降直接关系到设备能否装下推理过程。PVD给出的路线,是让较小专家承担各自的一段任务,按累计计算和质量共同衡量收益。

团队还用Unsplash照片继续训练,展示了光照、纹理与真实感调整的样例。后续可以研究怎样划分阶段、采用多少专家;密集物体计数和少见空间关系仍需单独检查。使用者可围绕自己的提示词集,测出实际显存、耗时与成功表达要求的比例。

参考资料

https://arxiv.org/abs/2610.08070

https://github.com/PolyU-VCLab/PVD

↑