arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

复旦、阿里提出AffineTok,20轮训练把图像生成gFID降低26%

作者:arXivDaily编辑部 arXiv 2608.23864 cs · cs.CV

扩散模型先在视觉分词器的潜空间里去噪,再把潜变量解码成图像。分词器即使能高质量重建图片,也不一定让后续去噪容易。复旦大学、阿里巴巴提出AffineTok,把潜空间中的语义组织方式纳入训练目标。

ImageNet 256实验中,AffineTok在20轮训练时把gFID从基线4.44降到3.28,降幅26%;训练到600轮后,无分类器引导gFID为1.21,有引导为1.10。成绩来自特定SiT配置,不能直接外推到所有数据集与生成架构。

平均语义与平均潜变量的语义并不相同

去噪过程面对带噪潜变量,要估计对应的干净潜变量均值,再送入解码器。过去的语义监督常直接从带噪潜变量预测干净图像语义,得到的是多个可能图像语义的平均。真正进入解码器的却是平均后的潜变量,两条路径一般不会自然一致。

论文Figure 1:SAC要求“语义的平均”与“平均潜变量的语义”一致,右侧展示MSAC与gFID的相关性。

团队把两者的一致性称为语义仿射一致性SAC。它关注的不是单张图能否重建,而是潜空间做插值、平均和去噪时,语义是否仍按可预测方式变化。论文还给出误差的正交分解,用于说明缺失项为什么会影响扩散训练。

MSAC先在训练分词器前做诊断

研究者为SAC设计分词器侧代理指标MSAC,不需要把每个分词器都完整接到大型扩散模型上训练后再判断。对14种视觉分词器测试时,MSAC与SiT-XL无引导gFID的Pearson相关系数达到0.960,高于论文对比的iFID相关性0.89。

这个相关性说明MSAC能在所测分词器和模型规模中预测生成难度,但相关不等于因果证明。论文因此又训练AffineTok,检验主动改善SAC后,扩散生成是否真的受益。

两个训练模块在部署时全部移除

AffineTok加入全局语义协调Token GSCT,让不同图像的干净潜变量在共享语义轴上排列;后验均值语义对齐PMSA则从带噪输入预测后验均值潜变量,并监督其解码语义。两个组件都只在分词器训练阶段存在。

论文Figure 2:GSCT协调干净潜变量语义,PMSA学习带噪输入对应的后验均值,两者均为训练期模块。

部署时,额外Token、后验预测器和语义投影器被拿掉,留下原有编码器和解码器路径。后续扩散模型不需要修改推理结构,代价主要发生在分词器训练阶段。

论文Figure 4:PMSA用带噪潜变量估计后验均值,并把语义一致性作为训练约束。

26%改善出现在训练早期

20轮时,AffineTok的gFID由4.44降到3.28,Inception Score从149.0升到181.3。随着训练延长,差距继续保持,600轮达到无引导1.21和有引导1.10。消融实验分别移除GSCT与PMSA,两个组件联合时综合结果最好。

论文Figure 5:加入GSCT与PMSA后,语义轴偏离和严重语义失败率在不同阈值下均明显下降。

下一步是跨数据和大模型验证

视觉分词器常被当作图像压缩模块,AffineTok把评估重心转向“潜空间是否适合去噪”。这为选择分词器提供了一个更接近生成任务的诊断工具,也可能减少反复训练大型扩散模型的试错成本。

当前主结果集中在ImageNet 256和SiT系列。后续要检查更高分辨率、文本条件生成、视频分词器和不同解码器中,MSAC是否仍保持高相关,并测量SAC约束会不会牺牲重建细节或下游编辑能力。

如果把MSAC用作分词器筛选指标,评测流程还应固定扩散骨干、训练预算和数据增强,避免把编码器规模或解码器容量的变化误记为潜空间更适合去噪。论文给出的0.960相关系数是14种分词器上的强信号,但跨任务采用前仍需重新标定;尤其在文本控制和视频生成里,时序一致性、提示词对齐可能与单图语义仿射性形成新的权衡。

参考资料

https://arxiv.org/abs/2608.23864

https://arxiv.org/html/2608.23864

https://michaelyu781.github.io/AffineTok-site/