arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2609.14344cs.SDcs.AIeess.AS

AURA:面向对话式音乐编辑的统一多模态框架

AURA: Unified Multimodal Framework for Conversational Music Editing

Quoc-Huy Trinh, Minh-Van Nguyen, Debesh Jha

首次发表
浏览论文内容

中文总结 AI 辅助

AURA提出统一多模态框架,利用多模态大语言模型和概念令牌实现对话式音乐编辑,仅优化9100万参数,在Slakh2100和MoisesDB上显著提升编辑正确性与内容保留。

中文摘要 AI 辅助

指令引导的音乐编辑器通常独立处理每个请求,这限制了它们支持用户逐步细化音轨的工作流的能力。我们提出AURA,一个用于对话式音乐编辑的统一多模态框架。AURA使用多模态大语言模型来解读完整的对话历史、可选的图像和参考音频,将编辑意图提炼为紧凑的概念令牌。一个概念到音频模块将这些令牌和帧对齐的参考特征注入冻结的MusicGen主干中,从而在保留未受影响内容的同时实现精确编辑。AURA仅优化9100万个参数,同时保留19亿个冻结主干参数。在Slakh2100和MoisesDB上的实验表明,与现有指令引导方法相比,在编辑正确性和内容保留方面有显著改进,包括在域外添加和移除任务中FAD降低4至5倍。

英文摘要

Instruction-guided music editors typically process each request independently, limiting their ability to support workflows in which users progressively refine a track. We introduce AURA, a unified multimodal framework for conversational music editing. AURA uses a multimodal large language model to interpret the complete dialogue history, an optional image, and reference audio, distilling the editing intent into compact concept tokens. A concept-to-audio module injects these tokens and frame-aligned reference features into a frozen MusicGen backbone, enabling precise edits while preserving unaffected content. AURA optimizes only 91M parameters while retaining 1.9B frozen backbone parameters. Experiments on Slakh2100 and MoisesDB demonstrate substantial improvements in edit correctness and content preservation over existing instruction-guided methods, including a 4-5 times reduction in FAD for out-of-domain addition and removal.

发表机构

  • Aalto University(阿尔托大学)
  • Technical University of Denmark(丹麦技术大学)
  • University of South Dakota(南达科他大学)
  • OpenRB Lab(OpenRB实验室)

机构由 AI 辅助整理,请以论文原文为准。

↑