AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation
AudioCALM:面向通用音频生成的连续自回归语言建模
机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) ; Tongyi Fun Team, Alibaba Group(阿里云团队,阿里巴巴集团)
AI总结 提出AudioCALM框架,通过连续音频潜变量的自回归预测和不对称模态专家架构,统一语音、声音和音乐生成,在三个任务上达到或超越专用模型性能。
Comments Preprint