UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
UniSonate:一种统一的语音、音乐和音效生成模型,通过文本指令控制
机构 * Tianjin University(天津大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 UniSonate通过统一的文本指令接口生成语音、音乐和音效,采用动态令牌注入机制和多阶段课程学习策略,提升跨模态生成性能,实现指令驱动的TTS和TTM的SOTA表现。
Comments Accepted to ACL 2026 main conference (oral)