FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation
FdAudio:用于一步文本到音频生成的均值流锚定弗雷歇距离训练后处理
机构 * National Taiwan University(国立台湾大学) ; Amazon(亚马逊)
AI总结 研究针对几步采样文本到音频生成模型一步生成质量落后的问题,提出FdAudio方法,通过多表示弗雷歇距离损失优化分布,并引入均值流一致性目标防止多步退化,在几步系统中提升了一步生成质量且解决了多步退化问题。
Comments Project website: https://fdoneaudio.github.io/