arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

画图算力砍到25%,谷歌等把预算留给复杂细节

作者:arXivDaily编辑部 arXiv 2610.12307 cs · cs.CV

论文导读

谷歌、伊利诺伊大学厄巴纳香槟分校联合提出BudgetPix,让图像生成按画面复杂程度分配计算。PixelDiT在25%预算下的GenEval得分为0.725,原模型满预算为0.721。模型把更多计算留给复杂细节,平坦区域使用更大的图块,同一套权重可以切换不同预算。

背景少分块,复杂细节多分块

一张图中,平坦背景和密集花纹需要的处理细致程度不同。常见生成模型把图片切成固定大小的块,各块得到同样的处理机会。BudgetPix根据局部画面的变化程度决定块大小:简单区域保留大块,纹理复杂的区域继续拆细。

论文示例里,一张512像素图片按16像素方块均匀划分需要1024个块,采用新方法的示例只用307个。另一组32像素方块对照从256个减少到127个。少一些块进入后续模型计算,预算就能随画面内容调整。

块越大,内部细节越难恢复。团队因此设计了把不同大小图块转成统一表示的步骤,并在输出时补回局部纹理。主体轮廓和复杂边缘保留细块,背景则不必始终以同一密度处理。

图:同一图片采用均匀分块与自适应分块,复杂区域更密,简单区域使用较大图块。

只减预算,对照同一只熊

论文的熊图像对照固定了文字要求和初始噪声,再改变计算预算。基础模型和几种合并图块方法在预算降低后逐渐丢失主体,BudgetPix在更低预算下仍能保留较清楚的熊和草地。这是一组定性案例,作用是展示退化发生在哪里。

研究将方法接到JiT、MiniT2I和PixelDiT等像素空间生成架构上。一个完成适配的模型可以在推理时切换预算,不必为每个预算重新训练一套模型。图块布局也会根据当前正在生成的画面更新,而不是只看最初的随机噪声。

预算比例对应图块数量和相关计算,实际加速还包括重新划分、编码和解码的成本。团队单独测量真实耗时,不能把25%预算直接写成速度变成四倍,也不能从一组清楚的熊图推断所有提示词都不损失画质。

图:同一熊图提示与初始噪声下,各方法随预算降低产生不同程度的细节退化。

25%预算,数字放在各自模型上

在1024像素的PixelDiT文生图测试中,BudgetPix用25%预算得到0.725的GenEval得分,原模型满预算为0.721;同一25%预算下,未适配的基础模型为0.323。DPG-Bench分别为83.7和原模型满预算84.8,两个指标并未完全一样。

512像素的MiniT2I-L测试中,25%预算的GenEval为0.874,原模型满预算0.882。类别条件的一步生成使用另一套模型,在60%预算下FID从2.65变为3.46。不同模型和任务的数字分别报告,质量变化不能统一概括成完全无损。

图表还比较输出与各自满预算图的接近程度,并加入人工对照和视觉模型打分。质量、忠实度和耗时一起看,才能知道省下的计算是否换来了用户能接受的结果。

图:文生图质量与实测加速、输出忠实度分别绘制,横轴口径并不相同。

应用前景:让同一生成模型适应资源预算

研究已在多种架构和分辨率上验证动态预算入口。生成服务可以据此比较不同预算的图像质量和耗时,再决定把快速预览与高质量输出放在哪一档;这是由现有实验支持的使用方向。

下一步仍需要把实际耗时、批处理表现和复杂文字细节放到具体硬件上测量。论文也实验了让同一批图片共享总预算,让简单图片少占计算、复杂图片多占计算,为批量生成提供了进一步测试路径。

参考资料

https://arxiv.org/abs/2610.12307

https://karaozgur.com/BudgetPix

↑