arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯混元把图像理解和生成塞进同一组Token,ImageNet最高改善10.57 gFID

作者:arXivDaily编辑部 arXiv 2607.22531 cs · cs.CV

图像理解需要语义,图像生成需要纹理细节,统一多模态模型常用两套不同表示。腾讯混元、香港中文大学、香港城市大学、厦门大学团队提出Twins,把ViT语义特征与VAE潜变量拼成同一组连续视觉Token,在不增加序列长度的情况下同时服务理解、重建和生成。

在ImageNet生成实验中,焦点回归目标相对朴素MSE最高改善10.57 gFID。这个数字描述指定训练设置下损失函数变化带来的生成指标差异,不是对所有统一多模态模型的全面排名。

理解与生成长期使用两套视觉语言

ViT特征擅长区分物体和语义,却会丢掉像素级纹理;VAE潜变量保留颜色、边缘和细节,更适合重建与生成,却不利于高层语义分离。把两者分开使用,模型理解自己生成的图片时还要“潜变量—像素—ViT特征”往返转换。

论文Figure 1:Twins把语义丰富的ViT特征和保留细节的VAE特征合成统一表示。

Twins沿通道维拼接两类特征,空间Token网格不变,因此注意力序列没有变长。问题随之转移到优化:同一个扩散Transformer会优先学会较容易预测的ViT部分,VAE分量误差更大。

焦点损失专门照顾难学的VAE维度

团队把分类任务中的焦点思想改成回归目标:误差较大的VAE维度获得更高权重,已经拟合良好的维度权重降低。这样可以在不丢失语义分支的情况下,把训练注意力拉回细节分支。

论文Figure 7:ViT与VAE特征拼接,生成侧使用焦点回归,理解侧经投影器进入语言模型。

论文把失衡归因于频率偏置、内在维度和条件不确定性差异。ViT特征更贴近类别条件,VAE潜变量还要承担颜色、纹理等不完全由类别决定的信息,后者天然更难预测。

细节重建和图像生成都能直接看出差别

重建对比中,单一语义表示更容易丢失高频细节,Twins保留的VAE分量可以补回纹理。该图说明同一批输入的可见差异,不等于每个样本都优于所有重建模型。

论文Figure 3:原图、RAE重建与Twins重建的高频细节对比。

生成实验中,MSE训练结果更容易模糊或变形,焦点目标生成的物体结构更完整。量化结果与定性案例共同支持“优化失衡影响生成质量”的判断。

gFID越低通常表示生成分布更接近真实图像分布,但它不直接衡量提示遵循、文字正确性或单张图片审美。10.57是论文指定ImageNet实验中两种训练目标的指标差,不等于图片质量提高10.57%,也不能与训练规模和评测设置不同的模型横向换算。

通道拼接保持Token数量不变,并不代表整个系统没有额外成本。视觉特征宽度增加后,输入投影、存储和部分计算仍可能变重;论文的优势是避免把两套表示拆成两段序列送入注意力。实际部署要同时比较序列长度、通道宽度、解码次数和端到端吞吐。

统一表示是否成立,还要看理解任务会不会被生成目标拖累。模型既要保留类别语义又要保存低层纹理,两类目标可能争夺容量。除生成指标外,后续实验应同时报告分类、问答和编辑能力,防止只改善一端却削弱另一端。

论文Figure 8:相同模型使用MSE或焦点损失时的生成样例。

下一步是让统一Token接受更大规模任务检验

Twins的工程价值是减少两套视觉表示之间的转换,让图像理解和生成共享更一致的接口。代码仓库已提供生成实验的训练配置和核心实现,便于复核焦点损失与潜空间设置。

当前实验仍以ImageNet和论文选定的理解基准为主。后续需要在更大分辨率、文本到图像、复杂视觉问答和多轮图像编辑中检验统一表示,并计算拼接通道后增加的存储与投影成本。

参考资料

https://arxiv.org/abs/2607.22531

https://arxiv.org/html/2607.22531

https://github.com/Tencent-Hunyuan/Twins