论文导读
论文公开页面未披露作者机构。SenseNova-U1.5是一款8B混合专家统一视觉模型,把图像理解、生成、编辑、多图参考和图文交错输出放进同一套端到端架构,并增加512到4096像素的高分辨率训练阶段;4K是论文报告的原生能力,不代表所有公开接口默认开放4K输出。
SenseNova-U1.5: Towards Native Unified Visual Intelligence
SenseNova-U1.5:迈向原生统一视觉智能
作者
Haiwen Diao, Jiahao Wang, Chenjing Ding, Hanming Deng, Jiangnan Chen, Ruixi Zhang, Ruohui Wang, Wenwen Tong, Xiangyu Fan, Yubo Wang, Yue Zhu, Yuwei Niu, Zhengqi Bai, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Bo Yang, Chen Feng, Chengguang Lv, Guangjia Liu, Guanlin Wang, Hanyu Zhang, Haojia Yu, Hongcan Xiao, Hongli Wang, Huan Wu, Huaping Zhong, Jian Fang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jing Zuo, Jingcheng Ni, Junxiang Xu, Linjun Dai, Mutian Xu, Peishen Yan, Penghao Wu, Ruijie Mao, Ruisi Wang, Shihao Bai, Shuang Yang, Shuya Yang, Shuyan Zheng, Silei Wu, Siying Li, Tao Chu, Tianbo Zhong, Tongxi Zhou, Weichao Luo, Weichen Fan, Wenhao Jia, Wenjie Gao, Xiangli Kong, Yan Li, Yang Yong, Zimo Wen, Zixuan Qian, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin
展开完整论文资料
- 作者
- Haiwen Diao, Jiahao Wang, Chenjing Ding, Hanming Deng, Jiangnan Chen, Ruixi Zhang, Ruohui Wang, Wenwen Tong, Xiangyu Fan, Yubo Wang, Yue Zhu, Yuwei Niu, Zhengqi Bai, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Bo Yang, Chen Feng, Chengguang Lv, Guangjia Liu, Guanlin Wang, Hanyu Zhang, Haojia Yu, Hongcan Xiao, Hongli Wang, Huan Wu, Huaping Zhong, Jian Fang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jing Zuo, Jingcheng Ni, Junxiang Xu, Linjun Dai, Mutian Xu, Peishen Yan, Penghao Wu, Ruijie Mao, Ruisi Wang, Shihao Bai, Shuang Yang, Shuya Yang, Shuyan Zheng, Silei Wu, Siying Li, Tao Chu, Tianbo Zhong, Tongxi Zhou, Weichao Luo, Weichen Fan, Wenhao Jia, Wenjie Gao, Xiangli Kong, Yan Li, Yang Yong, Zimo Wen, Zixuan Qian, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin
- Comments
- Project page: this https URL (https://github.com/OpenSenseNova/SenseNova-U1)
- AI 总结
- SenseNova-U1.5作为8B-MoT原生统一多模态模型,通过无编码器架构和专家蒸馏,在图像生成与编辑上取得显著提升,并验证了多模态理解向视觉规划迁移的可行性。
不再用两套视觉空间分别“看”和“画”
常见多模态模型用视觉编码器把图片压成语义特征,生成端再用VAE把潜变量还原成像素。两边目标不同:理解需要抓语义,生成需要保留颜色、纹理和位置。SenseNova-U1.5沿用NEO-unify路线,取消独立视觉编码器和VAE,让文字与图像补丁直接进入统一序列。
旧版把每个图像Token独立还原成RGB补丁,高分辨率下容易出现接缝和局部结构不一致。新版本在最终成像前让相邻补丁交换信息,颜色、纹理和几何可以联合决定。模型仍保持紧凑视觉序列,但补上了高分辨率最容易暴露的空间连续性问题。
图中展示文字与图像补丁在统一模型中的编码和解码路径。
生成、修图和多图参考放在同一个模型里
模型先训练理解分支,再初始化生成分支做像素空间流匹配。后训练阶段分别优化美学、双语文字、信息图、图像编辑等专家,最后用在策略蒸馏把多个专家的能力合并回一个模型。用户不必为“看图”“生图”“改图”切换完全不同的骨干。
论文展示了海报、人物、商品图、长文字排版和信息图生成,也展示局部替换、保持未修改区域和多参考图组合。样例能证明模型具备这些任务形式,但单张好看的展示图不能替代稳定性统计。
图1:模型在人物、海报、商品和信息图等任务上的生成样例。
图2:模型根据输入图进行局部编辑、身份保持和多参考组合。
4K来自专门训练阶段,不等于任意提示都稳
预训练先覆盖256到1024像素,训练18万步;随后加入512到4096像素数据,再训练10万步,并把序列长度从8196提高到20480。论文据此称模型具备原生4K生成能力。高分辨率训练解决的是模型能否直接处理更大画布,不保证每个复杂布局、细小文字和人物细节都无错误。
评测覆盖理解、图像生成、文字渲染、编辑和图文交错输出。不同基准使用自动指标或模型裁判,结果适合比较同一协议下的表现;真实设计任务还会受提示写法、内容审核、推理显存和采样时间影响。
下一步要公开训练代码并验证服务成本
论文写明将开放监督微调、强化学习和在策略蒸馏代码,项目页也提供Demo、代码仓库和模型集合。后续能否复现,取决于训练数据说明、权重开放范围和高分辨率推理配置。
统一架构的产品价值在于减少任务切换:模型先理解输入,再直接生成或编辑输出。落地时还要观察4K推理的显存、速度和失败率,以及双语长文字在真实海报中的可编辑性。论文证明了技术路线可行,服务端成本仍需单独评估。
参考资料
https://arxiv.org/abs/2609.11929
https://arxiv.org/html/2609.11929
https://github.com/OpenSenseNova/SenseNova-U1
https://unify.light-ai.top/