Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
通过交错语义、音频和文本标记扩展开放离散音频基础模型
机构 * Stanford University(斯坦福大学) ; University of Southern California(南加州大学) ; University of Cambridge(剑桥大学)
专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出SODA模型,通过交错语义、音频和文本标记扩展开放离散音频基础模型,实现通用音频生成和跨模态能力。