Social-MAE: A Transformer-Based Multimodal Autoencoder for Face and Voice
机构 * Numediart Institute, ISIA Lab, University of Mons(Numediart研究院、ISIA实验室、蒙斯大学) ; Institute for Creative Technologies, University of Southern California(创意技术研究所、南加州大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
Comments 5 pages, 3 figures, IEEE FG 2024 conference
Journal ref 2024 IEEE 18th International Conference on Automatic Face and Gesture Recognition (FG)