论文导读
阶跃星辰、ACE、香港中文大学、加州大学圣迭戈分校提出StepAudio 3 Music,把“先编曲、再出声音”写进音乐生成流程。模型支持歌曲、器乐、干声配伴奏和翻唱,单次长度最长5分30秒。中间的ABC记谱计划让和声、节奏和旋律结构进入生成上下文,长音乐不再只靠一段文字提示硬撑到底。
先写一份机器能读、人也能改的谱子
短音乐只要氛围对、音色顺,几十秒很快结束。完整歌曲还要处理主歌、副歌、段落转场、旋律发展和伴奏关系,提示词很难把这些决定精确放到时间线上。
StepAudio 3 Music加入ABC-CoT规划器。ABC是一种可用文本表达音高、时值和小节的记谱法,模型先根据歌词、描述和可选参考生成中间编曲计划,再预测音乐令牌。创作者可以检查或编辑这份计划,然后让后端继续渲染声音。
论文Figure 2:自回归模型先生成ABC编曲计划,再预测音乐令牌,流匹配DiT负责声音渲染。
离散计划和连续声音分开处理
系统把音乐压成每秒50个离散令牌,码本包含65536个条目。自回归骨干擅长处理歌词、描述、乐谱和长序列关系;随后,流匹配扩散Transformer预测连续潜变量,解码器把它还原成48kHz音频。
这种分工避免让一个模块同时承担“歌曲怎么写”和“每个瞬间听起来怎样”。训练还按阶段加入歌曲、器乐、伴奏和翻唱任务,再用直接偏好优化调整人类偏好的声音结果。论文没有把中间乐谱称为严格可执行的专业总谱,它承担的是结构化规划与可编辑接口。
论文Figure 1:StepAudio 3 Music在MuQ-MuLan、AudioBox与SongBench相关指标中的相对位置;各指标按本次比较的最高值归一化。
5分30秒覆盖整首歌,但榜单仍有边界
模型可生成最长5分30秒的歌曲和器乐,也能根据干人声生成伴奏,或在条件输入下合成翻唱。论文报告它在本次对比中取得最高的AudioBox内容愉悦度、内容可用性、制作质量和MuQ-MuLan相似度,SongBench结果保持竞争力。
在论文引用的初步Artificial Analysis Music Arena Vocals榜单上,StepAudio 3 Music的Quality Elo为1105,位于Suno V5.5和Mureka之后,高于Suno V5及若干其他系统。Elo会随新增样本和参赛模型变化,也只反映该榜单的主观比较,不能据此得出全面领先结论。
论文Figure 6:初步Artificial Analysis人声音乐榜单截图,StepAudio 3 Music的Quality Elo为1105。
下一步看计划能不能真正服务创作
ABC计划把长音乐生成从黑盒音频拉回到可检查的结构层。对创作者更实用的下一步,是验证局部改动能否稳定生效:修改一段和弦、移动副歌、替换旋律后,其他段落是否保持一致。项目页已经提供音频样例,后续还需观察模型、推理接口和计划编辑能力如何向真实产品开放。
此外,公开编辑工具和用户测试将决定这种计划层是否真的降低创作门槛。