视频生成正在变成一道长序列题:一段高分辨率视频摊成 token 后动辄十几万,扩散 Transformer 里的全注意力显存随帧数平方膨胀,训练账单越来越贵。Adobe Research 提出 Chimera,一套混合视觉扩散 Transformer 架构,并配套一套缩放方法,把线性注意力、压缩键值和稀疏专家编进同一条 token 流。
Chimera 总参数 110 亿,每个 token 实际激活约 20 亿,最终模型训练投入约 600 张 H100 天。团队在相同数据、相同扩散目标下与全注意力基线对照:达到同一训练损失时,完整系统的算力开销约为 Wan2.1 2B 基线的七分之一。
视频生成先撞上注意力墙
一张 4096×4096 的图像按 16×16 切块后已有约 6.5 万个视觉 token,视频、密集条件和多轮交互还会把序列继续拉长。主流扩散 Transformer 仍依赖完整自注意力,token 两两交互,计算量随序列长度平方增长。语言模型更早遇到这堵墙,解法是稀疏注意力、压缩键值、线性循环算子和稀疏激活,但这些不能直接照搬:扩散模型要保留二维、三维网格上的局部结构,要支持文本、图像、视频之间的双向交互,还要在去噪目标下有效。
Chimera 的回答是不押注单一注意力,而是按序列层级分工,并用一条统一的光栅扫描 token 流处理文本、图像和视频,连显式位置编码都省掉。
一条 token 流里的三种注意力
大部分层使用 KDA(Kimi Delta Attention),这是一种线性复杂度的状态跟踪注意力,显存占用固定、不随序列长度增长,负责长程状态;每隔几层穿插一层 MLA(多头潜在注意力),用低秩压缩的键值表示保留直接的全局 token 交互,节奏约为三层 KDA 配一层 MLA。每次状态更新前,还有模态感知的短卷积沿图像的空间轴或视频的时间轴聚合邻居,让写进循环状态的是带局部上下文的特征,而不是孤立 token。
前馈部分换成稀疏 MoE:每层 56 个路由专家,每个 token 只激活其中 8 个,激活比例约七分之一,容量做大而单 token 算力受控;配合 iHC 恒等超连接在多条残差流上自适应读写,稳定深层信号。跨宽度、深度缩放时,HeteroP 按每个张量的功能扇入和模型深度分别迁移学习率、初始化和残差缩放,使小模型上调好的配方能直接搬到大模型。
图1:Chimera 把 KDA 线性注意力、周期性 MLA 全局注意力与 56 专家 MoE 编进同一条 token 流,并以 iHC 恒等超连接在多条残差流上稳定深层信号。
同一条损失线,算力省到七分之一
团队把 Wan2.1、Z-Image 与两个 Chimera 变体都做成 20 亿激活参数规模,用相同数据、相同扩散目标训到同一算力预算。在共同的训练损失 0.149 处,Wan2.1 需要约 4.29×10²⁰ 次浮点运算,Chimera 稠密变体只用 2.55×10²⁰,效率约 1.7 倍;加上 MoE、iHC 和 HeteroP 的完整系统仅用约 6.27×10¹⁹,效率提升到 7.3 倍,即同损失算力约为基线的七分之一。
组件消融把收益拆得很清楚:稠密基线换 MoE 后达到同一损失的算力收益约 1.5 倍,再加 iHC 到 1.7 倍,最后叠加 HeteroP 到 4.1 倍,其中异构超参迁移的单项贡献最大。
图2:相同训练损失下,完整 Chimera 的算力曲线始终低于 Wan2.1、Z-Image 等全注意力基线。
图3:从稠密到 MoE、再加 iHC、最后叠加 HeteroP,达到同一损失的累计算力收益依次为 1.5、1.7、4.1 倍。
152k token 爆显存,它撑到 255k
在单张 80GB 的 A100 上做前向推演,全注意力对照模型在约 15.2 万 token 处显存耗尽,而 KDA/MLA 骨架可以跑完 25.5 万 token 的测试,可承载序列长度约为前者的 1.68 倍;在 25.5 万 token 处,它的前向延迟还要快 2.14 倍。原因是 KDA 每层只保留固定大小的循环状态,不像多头注意力那样缓存随序列线性变长的键值张量,周期性的 MLA 层则保证全局交互不丢。
去掉位置编码还带来一个额外好处:长度可以外推。模型只在 5 秒、81 帧的片段上训练,不做任何时长微调,就能直接生成 5 到 30 秒的视频;评测只看每段视频最后 5 秒,Chimera 的帧级 FID 相对自身 5 秒成绩仅退化约 6.5%,而对照方法退化超过 50%。
图4:全注意力在约 152k token 处显存耗尽,KDA/MLA 可完成 255k token 前向,并在该长度快 2.14 倍。
图5:只用 5 秒片段训练,Chimera 零样本生成 30 秒视频,末 5 秒 FID 相对退化约 6.5%,明显小于对照模型。
600 张 H100 天之后,效率路线走向哪里
约 600 张 H100 天的训练投入,是这套架构最直观的注脚——作为参照,论文提到 Z-Image-Turbo 公布的训练预算约为 1.24 万张 H100 天,约为 Chimera 的二十倍;Chimera 在 GenEval、DPG-Bench 上也与 FLUX.1-dev、Z-Image-Turbo 等强模型表现接近,并能零样本生成 2K、4K 图像。
需要看清边界:缩放研究固定了 MoE 路由、MLA 压缩率与层间比例等结构轴,效率结论主要来自预训练扩散损失曲线和 20 亿激活参数级别的受控对照,而非大规模生成评测。对长视频而言,这套结果更像一张省钱路线图:注意力不必全程平方计算,容量也不必全部激活,真正的考卷仍是更长、更复杂场景下的成片质量。