arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

ECCV 2026|英伟达等提出HRDiT,现成DiT不重训也能生成8K图像

arXiv 2608.07003 cs.CV

把FLUX、Stable Diffusion 3这类DiT直接拉到8K,常出现窗户错位、物体重复和整体结构散架,计算时间也陡增。兰卡斯特大学、华南理工大学与英伟达AI技术中心提出ECCV 2026论文HRDiT,通过空间位置重排和分层注意力剪枝,无需重新训练原模型,即可扩展到8192×8192生成。

分辨率一升,结构和速度一起失控

DiT把图像表示成大量视觉词元。分辨率翻倍后,词元数按面积增长,全局注意力成本进一步呈二次上升。论文测得,直接生成8K时,FLUX和Stable Diffusion 3的多头注意力计算占总耗时90%以上,单张分别需要1385秒和646秒。

更麻烦的是,预训练模型主要见过较低分辨率。机械扩大位置网格,会让相距很远的词元建立混乱关系,局部物体也可能被拆散到不连续位置。样例中,建筑线条、人物肢体和重复纹理出现明显空间错乱;单纯分块虽然更快,又容易失去跨区域一致性。

直接放大DiT时出现的空间错乱现象

高分辨率失败不只是细节模糊,还包括全局布局和局部结构同时失真。

SPA先把空间关系重新排好

HRDiT的第一部分是Spatial Position Arrangement。它把高分辨率词元组织为具有空间连续性的束,并在逐级放大过程中滑动位置索引,让相邻区域仍能沿用预训练模型熟悉的相对位置模式。这样做不修改模型参数,而是在推理时重新安排词元如何进入注意力。

论文采用级联生成,从1K逐步扩展到2K、4K和8K。较低分辨率先确定整体构图,高分辨率阶段再补充局部内容,减少模型一次面对超大陌生网格的压力。SPA在4K上的额外开销较小:示例耗时从203秒增至212秒,却显著改善结构连贯性。

HAP把算力留给有用的注意力头

第二部分Hierarchical Attention Pruning观察不同注意力头的有效范围。有些头主要处理附近纹理,没有必要在整张8K图上搜索;另一些头承担长程布局,需要保留更大视野。HAP按头分配不同层级的注意力范围,并剪掉贡献较低的远程连接。

这种设计避开了“一刀切”窗口:所有头都做全局注意力太慢,所有头都限制为局部又会破坏整体。HRDiT按功能保留少量长程通道,让多数计算集中于更相关的空间区域,从而在改善质量的同时回收SPA带来的计算成本。

8K生成中注意力占比与耗时分析

原始DiT在8K时九成以上时间花在注意力上,因而剪枝空间尤其大。

下一步扩展到更多DiT与创作场景

团队在FLUX与Stable Diffusion 3上使用1000条LAION-5B文本进行评估,并与多种免训练高分辨率方法比较。论文主文展示2K、4K结果,补充实验进一步报告8K:HRDiT在两种骨干上都取得更好的质量与速度,并减少建筑、人物和密集物体中的空间错乱。

8K实验采用逐级生成,而不是从随机噪声一步直出最终尺寸:FLUX在1K、2K、4K和8K阶段分别使用30、16、10和8个采样步,SD3对应28、8、6和5步。这一细节解释了方法如何控制超大画布成本,也意味着与普通1K生图的耗时不能直接比较。结果证明的是现有骨干可被扩展,并非取消高分辨率计算本身。

HRDiT与其他高分辨率生成方法的视觉比较

比较使用相同DiT骨干,重点观察结构连贯性,而非只看局部纹理锐度。

HRDiT下一步可以扩展到更多DiT骨干,并针对海报、游戏资产、建筑概念图和大幅面设计建立高分辨率评测。SPA负责保持布局,HAP负责控制注意力成本,这两部分也可以与局部重绘、可控构图和分区域细化结合。

8K生成仍采用多级采样,需要高显存硬件和可观的等待时间;项目当前重点验证FLUX与SD3。后续若能进一步减少高分辨率阶段的采样步数,并让注意力范围随图像内容自适应,免训练扩展就能覆盖更多创作工作流,而不必为每个分辨率重新训练基础模型。

参考资料

https://arxiv.org/abs/2608.07003

https://github.com/LancasterAIResearch/HRDiT