VIBE: Video Instruction-aligned Background music gEneration
VIBE:视频指令对齐背景音乐生成模型
机构 * Dolby Laboratories(杜比实验室) ; University of Maryland, College Park(马里兰大学帕克分校)
AI总结 VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。
高校专区
VIBE:视频指令对齐背景音乐生成模型
机构 * Dolby Laboratories(杜比实验室) ; University of Maryland, College Park(马里兰大学帕克分校)
AI总结 VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。
TEMPO:面向大型音频-语言模型的时序锚定多任务后训练
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; CNH Industrial India(凯斯纽荷兰工业印度公司)
AI总结 TEMPO是首个处理音频、语音和音乐时间戳任务的统一模型,通过SFT结合GRPO方法,在10K样本评估基准上优于Audio Flamingo Next等最先进模型。
Comments Accepted at EMNLP 2026 Main Conference. Project page - https://kaousheik-26.github.io/tempo
SHADOWBENCH:迈向自动形式化中语义对齐的可靠自动评估
机构 * Electronics and Telecommunications Research Institute(电子通信研究院) ; Seoul National University(首尔大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; Amazon Web Services(亚马逊网络服务)
AI总结 针对自动形式化评估的缺陷,该研究提出SA-Pass方法并构建ShadowBench基准,实验显示其与专家判断一致性达98.8%,且被用作ICML 2026 AI4Math挑战赛第4赛道基准。
Comments EMNLP 2026
Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing