CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content
CoVA: 基于文本引导的复合视频检索用于音频视觉内容
专题命中 音频语音多模态 :audio-visual(title);cross-modal(abstract);分类 cs.CV
AI总结 CoVA通过整合视频、音频和文本特征,解决音频视觉内容检索中的跨模态变化问题,提出AVT复合融合方法并构建AV-Comp基准。
Comments Please visit our project page at https://perceptualai-lab.github.io/CoVA/