Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
通过交错语义、音频和文本标记扩展开放离散音频基础模型
机构 * Stanford University(斯坦福大学) ; University of Southern California(南加州大学) ; University of Cambridge(剑桥大学)
AI总结 本文提出SODA模型,通过交错语义、音频和文本标记扩展开放离散音频基础模型,实现通用音频生成和跨模态能力。