arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

8B模型直出4K图,SenseNova-U1.5把看图和生图塞进一套架构

作者:arXivDaily编辑部 arXiv 2609.11929 cs · cs.CV

论文导读

论文公开页面未披露作者机构。SenseNova-U1.5是一款8B混合专家统一视觉模型,把图像理解、生成、编辑、多图参考和图文交错输出放进同一套端到端架构,并增加512到4096像素的高分辨率训练阶段;4K是论文报告的原生能力,不代表所有公开接口默认开放4K输出。

不再用两套视觉空间分别“看”和“画”

常见多模态模型用视觉编码器把图片压成语义特征,生成端再用VAE把潜变量还原成像素。两边目标不同:理解需要抓语义,生成需要保留颜色、纹理和位置。SenseNova-U1.5沿用NEO-unify路线,取消独立视觉编码器和VAE,让文字与图像补丁直接进入统一序列。

旧版把每个图像Token独立还原成RGB补丁,高分辨率下容易出现接缝和局部结构不一致。新版本在最终成像前让相邻补丁交换信息,颜色、纹理和几何可以联合决定。模型仍保持紧凑视觉序列,但补上了高分辨率最容易暴露的空间连续性问题。

图中展示文字与图像补丁在统一模型中的编码和解码路径。

生成、修图和多图参考放在同一个模型里

模型先训练理解分支,再初始化生成分支做像素空间流匹配。后训练阶段分别优化美学、双语文字、信息图、图像编辑等专家,最后用在策略蒸馏把多个专家的能力合并回一个模型。用户不必为“看图”“生图”“改图”切换完全不同的骨干。

论文展示了海报、人物、商品图、长文字排版和信息图生成,也展示局部替换、保持未修改区域和多参考图组合。样例能证明模型具备这些任务形式,但单张好看的展示图不能替代稳定性统计。

图1:模型在人物、海报、商品和信息图等任务上的生成样例。

图2:模型根据输入图进行局部编辑、身份保持和多参考组合。

4K来自专门训练阶段,不等于任意提示都稳

预训练先覆盖256到1024像素,训练18万步;随后加入512到4096像素数据,再训练10万步,并把序列长度从8196提高到20480。论文据此称模型具备原生4K生成能力。高分辨率训练解决的是模型能否直接处理更大画布,不保证每个复杂布局、细小文字和人物细节都无错误。

评测覆盖理解、图像生成、文字渲染、编辑和图文交错输出。不同基准使用自动指标或模型裁判,结果适合比较同一协议下的表现;真实设计任务还会受提示写法、内容审核、推理显存和采样时间影响。

下一步要公开训练代码并验证服务成本

论文写明将开放监督微调、强化学习和在策略蒸馏代码,项目页也提供Demo、代码仓库和模型集合。后续能否复现,取决于训练数据说明、权重开放范围和高分辨率推理配置。

统一架构的产品价值在于减少任务切换:模型先理解输入,再直接生成或编辑输出。落地时还要观察4K推理的显存、速度和失败率,以及双语长文字在真实海报中的可编辑性。论文证明了技术路线可行,服务端成本仍需单独评估。

参考资料

https://arxiv.org/abs/2609.11929

https://arxiv.org/html/2609.11929

https://github.com/OpenSenseNova/SenseNova-U1

https://unify.light-ai.top/