arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2607.11738eess.AS

Qwen-Audio-VAE技术报告

Qwen-Audio-VAE Technical Report

Ziyue Jiang, Dake Guo, Zekai Zhang, Hangrui Hu, Ting He, Xinfa Zhu, Xiong Wang, Yongqi Wang, Jiapeng Wang, Wenxiang Guo, Zhifang Guo, Chenfei Wu, Dayiheng Liu, Jin Xu

首次发表
浏览论文内容

中文总结 AI 辅助

介绍Qwen-Audio-VAE,一套用于通用音频生成的低比特率、快速编码自动编码器。它结合因果编解码器、窗口Transformer块和多判别器训练,在多域音频上大规模训练,通过非对称主干和剪枝提高效率,实验证明其泛化好且高效。

中文摘要 AI 辅助

我们介绍了Qwen-Audio-VAE,这是一套为可扩展的通用音频生成而设计的低比特率、快速编码的连续音频自动编码器。该模型基于一个简单但重要的原则构建:音频VAE不仅要以高保真度重建多样的音频,还要快速生成紧凑的潜在表示以支持大规模文本到音频的训练。Qwen-Audio-VAE结合了因果编码器-解码器、窗口Transformer块和多判别器训练,在重建质量和压缩率之间取得了良好平衡。该模型在500万小时的多域音频上进行了大规模训练,能够在异构声学条件下进行稳健重建。为进一步提高计算效率,采用了非对称编码器-解码器主干并引入延迟感知编码器剪枝以最大化编码吞吐量。在公共语音、音乐和声音重建基准上的实验表明,Qwen-Audio-VAE在不同音频域上具有良好的泛化能力且特别高效,编码32分钟音频仅需541毫秒。总体而言,Qwen-Audio-VAE为高效的通用音频生成提供了高质量、紧凑且高吞吐量的表示主干。

英文摘要

We introduce \textbf{Qwen-Audio-VAE}, a suite of low-bitrate, fast-encoding continuous audio autoencoders designed for scalable general audio generation. The model is built around a simple but important principle: an audio VAE should not only reconstruct diverse audio with high fidelity, but also produce compact latent representations fast enough to support large-scale text-to-audio training. Qwen-Audio-VAE combines a causal encoder-decoder, window Transformer blocks, and multi-discriminator training to achieve a strong balance between reconstruction quality and compression rate. The model is trained at scale on 5 million hours of multi-domain audio, enabling robust reconstruction across heterogeneous acoustic conditions. To further improve computational efficiency, we adopt an asymmetric encoder-decoder backbone and introduce latency-aware encoder pruning to maximize encoding throughput. Experiments on public speech, music, and sound reconstruction benchmarks show that Qwen-Audio-VAE generalizes well across diverse audio domains and is particularly efficient, requiring only 541 ms to encode 32 minutes of audio. Overall, Qwen-Audio-VAE provides a high-quality, compact, and high-throughput representation backbone for efficient general audio generation.

↑