WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入
机构 * Tsinghua University(清华大学) ; WeChat Vision, Tencent Inc.(腾讯公司)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract)
AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。