CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning
CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐
机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) ; University of Oulu(奥卢大学) ; Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)
AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。