HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training
机构 * Xi'an Jiaotong University(西安交通大学) ; Zhengzhou University(郑州大学) ; University of Science and Technology of China(中国科学技术大学) ; Dalian University of Technology(大连理工大学) ; Zhejiang Lab(浙江实验室)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV