arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

文字不再非得一个个吐?华科&地平线用连续流统一图文生成

作者:arXivDaily编辑部 arXiv 2609.40362 cs · cs.CV

论文导读

华中科技大学、北京交通大学与地平线提出Multimodal Flow,把文字和图像都放进连续空间,用同一套流匹配目标训练理解与生成。模型可处理图文问答、描述和图像生成;论文以5幅图、10张表报告实验,但“统一”指训练机制,不意味着所有任务都已超过专用模型。

多模态模型通常有两套生成逻辑

文字模型习惯按离散Token逐个预测,图像模型则在连续潜空间反复去噪。把两者拼在一起时,网络要维护不同目标、采样器和数据路径,图文交错序列还会频繁切换。Multimodal Flow把文字嵌入和视觉表示都视为连续状态,让它们沿同一种流从噪声走向目标,减少训练机制的分叉。

图:范式图比较文字离散生成、图像连续生成与共享连续目标,突出统一发生在哪一层。

同一条流既要读懂也要生成

架构保留文本、视觉编码与解码模块,但中间的Multimodal Flow共同处理两种状态。预训练把图文片段混合成序列,训练时对目标块施加流匹配损失;推理时可缓存已经确定的上下文,只对当前片段采样。这样,一个模型既能根据图片回答,也能根据文字生成图片或续写交错内容。

图:序列中的文字块和图像块共享流模型,干净历史块被缓存,当前目标块继续采样。

表示选择会同时影响理解和生成

论文比较DINO、SigLIP、FLUX.2、SD-VAE和像素等视觉表示,并用GenEval、DPG-Bench、CIDEr与CLIPScore等指标检查不同任务。结果说明,没有一种表示在所有目标上天然占优:强调语义的编码有利于理解,适合重建的表示更利于生成。全连续路线减少了目标分裂,但仍需在表示容量和采样成本之间折中。

图:柱状图按生成与理解指标比较视觉表示,右侧流程说明分块训练和采样如何衔接。

下一步要证明连续文字是否真的划算

连续生成文字绕开固定词表,也带来解码稳定性、长文本一致性和推理速度问题。后续应在更长对话、更高分辨率图像和复杂交错文档中,与成熟自回归系统比较端到端成本。若统一目标能减少工程分支而不牺牲可控性,它可能成为多模态基础模型的新骨架。

产品验证可以挑选真正需要图文交错的任务,而不是把所有能力压成一个平均分。例如让模型阅读两张图后生成带配图说明的回答,分别检查文字事实、图像与指令对齐、跨片段引用和总延迟。连续文字若需要更多采样步,统一架构带来的训练简化可能被推理成本抵消;反之,缓存历史块若能减少重复计算,长文档会更受益。还应测试数字、代码和专有名词,因为连续嵌入解码的一处偏差可能变成完全不同的离散字符串。

这些高精度字符串测试应单独报告,不能被综合分数掩盖。

参考资料

https://arxiv.org/abs/2609.40362

https://arxiv.org/html/2609.40362

↑