arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.16104cs.CV

Nexus:使用整流流模型实现高效文本到图像生成的结构化协同框架

Nexus: Structured Synergy for Efficient Text-to-Image Generation using Rectified Flow Model

Yizhao Wang

首次发表
浏览论文内容

中文总结 AI 辅助

该研究针对文本到图像生成模型计算量大、复杂度高的问题,提出集成稀疏架构、线性复杂度与低比特量化的Nexus模型,结合MoE前馈层等技术,在保持与SDXL、SD3相当生成质量的同时提升推理效率,经COCO、LAION验证有效。

中文摘要 AI 辅助

扩散模型和流匹配模型在文本到图像生成领域已取得显著进展,但高计算量、二次复杂度及大内存占用阻碍了高分辨率合成与边缘部署。我们提出Nexus,该模型集成了稀疏架构、线性复杂度与低比特量化,结合MoE前馈层、门控DeltaNet注意力机制及逐专家低比特训练以降低计算与内存消耗。通过联合优化,Nexus在实现与SDXL、SD3等主流模型相当的生成质量的同时,具备显著更高的推理效率。在COCO和LAION数据集上开展的实验验证了其有效性。

英文摘要

Diffusion and flow matching models have made significant progress in text-to-image generation, yet high computation, quadratic complexity, and large memory footprint hinder high-resolution synthesis and edge deployment. We propose Nexus, which integrates sparse architecture, linear complexity, and low-bit quantization. It combines MoE feed-forward layers, gated DeltaNet attention, and per-expert low-bit training to reduce computation and memory. Their joint optimization allows Nexus to achieve generation quality comparable to mainstream models such as SDXL and SD3 while delivering markedly higher inference efficiency. Experiments on COCO and LAION validate its effectiveness.

发表机构

  • School of Computer Science, Henan Institute of Science and Technology(河南科技学院计算机学院)

机构由 AI 辅助整理,请以论文原文为准。

补充信息

↑