FdAudio:用于一步文本到音频生成的均值流锚定弗雷歇距离训练后处理
FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation
浏览论文内容
中文总结 AI 辅助
研究针对几步采样文本到音频生成模型一步生成质量落后的问题,提出FdAudio方法,通过多表示弗雷歇距离损失优化分布,并引入均值流一致性目标防止多步退化,在几步系统中提升了一步生成质量且解决了多步退化问题。
中文摘要 AI 辅助
虽然最近像MeanAudio这样的几步采样文本到音频生成模型通过对平均速度建模显著加速了生成,但它们严格的一步生成质量仍远远落后于多步模型。我们提出FdAudio来弥合这一差距。与仅依赖对目标速度场进行回归的MeanAudio不同,我们的训练后处理方法通过多表示弗雷歇距离(FD)损失直接在预训练嵌入空间中优化最终的一步分布。关键的是,为防止FD损失的简单训练后处理导致的多步退化,我们引入均值流一致性目标作为结构锚。结果表明,FdAudio在几步系统中建立了一步文本到音频生成的最优质量,相对于基线MeanAudio框架,FD分数降低了11.4%,FAD分数提高了28.8%。值得注意的是,我们通过提出均值流锚解决了FD训练后处理的简单多步退化问题,使25步采样路径能够以低得多的计算延迟保持与强大的多步模型相当或更好的高保真音频合成。
英文摘要
While recent few-step sampling text-to-audio generation models like MeanAudio substantially accelerate generation by modeling average velocities, their strict one-step generation quality still lags significantly behind multi-step counterparts. We propose FdAudio to bridge this gap. Unlike MeanAudio, which relies solely on regression against target velocity fields, our post-training approach optimizes the final one-step distribution directly across pre-trained embedding spaces via a multi-representation Fréchet-distance (FD) loss. Crucially, to prevent the multi-step degradation that naive post-training with FD-loss causes, we introduce a MeanFlow consistency objective as a structural anchor. Results demonstrate that FdAudio establishes state-of-the-art one-step T2A generation quality among few-step systems, yielding an 11.4% reduction in FD score and a 28.8% improvement in FAD score relative to the baseline MeanAudio framework. Notably, we solve FD post-training's naive multi-step degradation issue by proposing the MeanFlow anchor, enabling a 25-step sampling path to maintain high-fidelity audio synthesis that matches or surpasses strong multi-step models at a fraction of their computational latency.
发表机构
- National Taiwan University(国立台湾大学)
- Amazon(亚马逊)
机构由 AI 辅助整理,请以论文原文为准。