字节跳动提出面向游戏资产的RGBA视频生成方法GameAlpha。它从一张参考图出发,一次生成RGB彩色帧和Alpha透明遮罩,角色动画可以直接叠加到不同背景中。
团队同时建立GameAlpha-2.4K数据集,并设计“可见性路由器”:提前识别透明Token,让它们跳过后续DiT更新。路由器在最后两个去噪步骤跳过35%的Token计算,带来1.2倍骨干网络加速。
先生成RGB再抠像,半透明边缘容易被背景污染
传统流程先生成带背景的视频,再用抠像模型分离角色。对头发、光晕、烟雾和半透明布料而言,RGB像素已经混入原背景,后处理很难恢复稳定Alpha,帧间还会闪烁。
GameAlpha在同一个生成过程中联合建模外观和透明度。这让模型在画出角色的同时就决定每个像素应该如何与新背景混合,不必在成片后猜测边界。
GameAlpha-2.4K覆盖人形角色、生物、道具和多种动作,同时保留透明通道。
3000组候选经多假设抠像和合成门禁筛成2400段
游戏风RGBA视频的现成公开数据不足,团队从受控提示组合出发,用适合抠像的背景生成候选视频,对每段运行多个Alpha恢复候选,再通过重新合成检查边缘、透明结构和时序稳定性。
数据流程从提示覆盖、视频生成、Alpha恢复走到合成质量门禁。
数据集最终保留2400段游戏风片段,用实体、动作、装备、风格层级和视角等维度控制覆盖。这些引导让训练集不至于被少数人形角色或简单动作占满。
透明Token提前退场,但仍沿原去噪时间表前进
路由器在较早阶段估计Token可见性。已经确认透明的区域不再执行后面的DiT块,但它们不是被简单删除;x0-lock使其继续沿原流匹配调度,向自预测终点演化。这一设计用来避免硬剪枝导致透明区域突然失稳。
可见性路由根据Alpha预测选择需要继续更新的Token。
对比密集推理,路由版的FVD从172.3变为174.4,DINO身份一致性同为0.840,美学分从5.317变为5.314,论文将这视为质量基本不变。1.2倍是骨干网络加速,不是包含所有前后处理的端到端制作速度。
主实验还将GameAlpha与“先生成RGB、再使用BiRefNet、MatAnyone2、SAM3或UniVidX抠像”的多组管线比较。在游戏风测试上,路由版FVD为174.4,多个两阶段方案介于221.3到470.6之间;它的运动平滑度为0.988,同时推理时间为104.8秒,而某些需要重型视频抠像的管线超过4000秒。
团队没有只将透明度当作输出通道,还检查中间层是否已经可以读出Alpha。线性探针显示,透明支持区在较早去噪阶段就有可分性,这才使得路由器可以在后两步决定哪些Token无需继续经过完整DiT。如果等到最终Alpha已完全生成才剪枝,就不会再有计算收益。
消融实验也揭示了不能直接丢掉透明Token。Drop-KV虽然达到1.3倍加速,但质量指标开始下降;去掉重激活或使用随机路由时,FVD大幅恶化。x0-lock的作用正是让“不再进入重型网络”与“仍然按正确噪声时间表演化”同时成立。
下一步走向可直接复用的游戏动画资产
数据集的提示不只描述角色身份,还组合装备、动作、镜头视角和风格层级。对实际美术管线而言,这些属性决定了生成资产能否进入同一游戏的视觉规范。后续评测除了FVD和身份相似度,还需要加入美术师对边缘可编辑性、循环动画衔接和引擎合成效果的人工判断。
RGBA视频的直接用途是把角色、特效和道具动画放入不同场景,少做一轮逐帧抠像和边缘修复。GameAlpha已验证参考图驱动的联合生成,下一步需要在更长动画、复杂遮挡和真实游戏引擎合成链中检验时序稳定性。
对比图展示不同方法在游戏角色、生物和道具上的RGB与Alpha结果。