Qwen-Audio-VAE技术报告
Qwen-Audio-VAE Technical Report
浏览论文内容
中文总结 AI 辅助
介绍Qwen-Audio-VAE,一套用于通用音频生成的低比特率、快速编码自动编码器。它结合因果编解码器、窗口Transformer块和多判别器训练,在多域音频上大规模训练,通过非对称主干和剪枝提高效率,实验证明其泛化好且高效。
中文摘要 AI 辅助
我们介绍了Qwen-Audio-VAE,这是一套为可扩展的通用音频生成而设计的低比特率、快速编码的连续音频自动编码器。该模型基于一个简单但重要的原则构建:音频VAE不仅要以高保真度重建多样的音频,还要快速生成紧凑的潜在表示以支持大规模文本到音频的训练。Qwen-Audio-VAE结合了因果编码器-解码器、窗口Transformer块和多判别器训练,在重建质量和压缩率之间取得了良好平衡。该模型在500万小时的多域音频上进行了大规模训练,能够在异构声学条件下进行稳健重建。为进一步提高计算效率,采用了非对称编码器-解码器主干并引入延迟感知编码器剪枝以最大化编码吞吐量。在公共语音、音乐和声音重建基准上的实验表明,Qwen-Audio-VAE在不同音频域上具有良好的泛化能力且特别高效,编码32分钟音频仅需541毫秒。总体而言,Qwen-Audio-VAE为高效的通用音频生成提供了高质量、紧凑且高吞吐量的表示主干。
英文摘要
We introduce \textbf{Qwen-Audio-VAE}, a suite of low-bitrate, fast-encoding continuous audio autoencoders designed for scalable general audio generation. The model is built around a simple but important principle: an audio VAE should not only reconstruct diverse audio with high fidelity, but also produce compact latent representations fast enough to support large-scale text-to-audio training. Qwen-Audio-VAE combines a causal encoder-decoder, window Transformer blocks, and multi-discriminator training to achieve a strong balance between reconstruction quality and compression rate. The model is trained at scale on 5 million hours of multi-domain audio, enabling robust reconstruction across heterogeneous acoustic conditions. To further improve computational efficiency, we adopt an asymmetric encoder-decoder backbone and introduce latency-aware encoder pruning to maximize encoding throughput. Experiments on public speech, music, and sound reconstruction benchmarks show that Qwen-Audio-VAE generalizes well across diverse audio domains and is particularly efficient, requiring only 541 ms to encode 32 minutes of audio. Overall, Qwen-Audio-VAE provides a high-quality, compact, and high-throughput representation backbone for efficient general audio generation.