arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Maryland, College Park(马里兰大学帕克分校)

2026-09-01 至 2026-09-01 共收录 3
2608.30125 2026-09-01 cs.SD cs.AI cs.CL cs.CV cs.LG 新提交

VIBE: Video Instruction-aligned Background music gEneration

VIBE:视频指令对齐背景音乐生成模型

Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj, Gouthaman KV, Sreyan Ghosh, Ramani Duraiswami, Lie Lu, Dinesh Manocha

机构 * Dolby Laboratories(杜比实验室) University of Maryland, College Park(马里兰大学帕克分校)

AI总结 VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29999 2026-09-01 cs.SD cs.AI cs.LG 新提交

TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

TEMPO:面向大型音频-语言模型的时序锚定多任务后训练

Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh, Utathya Aich, Ramani Duraiswami, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) CNH Industrial India(凯斯纽荷兰工业印度公司)

AI总结 TEMPO是首个处理音频、语音和音乐时间戳任务的统一模型,通过SFT结合GRPO方法,在10K样本评估基准上优于Audio Flamingo Next等最先进模型。

Comments Accepted at EMNLP 2026 Main Conference. Project page - https://kaousheik-26.github.io/tempo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29270 2026-09-01 cs.CL cs.AI 新提交

SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization

SHADOWBENCH:迈向自动形式化中语义对齐的可靠自动评估

Hojae Han, Jongyoon Kim, Sanghyuk Park, Dongwook Cheon, Myungjae Jeon, Sunjong Choi, Soonho Kong, Wonseok Heo, Seung-won Hwang, Donghoon Hyeon

机构 * Electronics and Telecommunications Research Institute(电子通信研究院) Seoul National University(首尔大学) University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services(亚马逊网络服务)

AI总结 针对自动形式化评估的缺陷,该研究提出SA-Pass方法并构建ShadowBench基准,实验显示其与专家判断一致性达98.8%,且被用作ICML 2026 AI4Math挑战赛第4赛道基准。

Comments EMNLP 2026

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏