BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
Comments ICASSP 2024. Code: https://github.com/ahaliassos/raven
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
Comments ICASSP 2024. Code: https://github.com/ahaliassos/raven
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments To Appear in Findings of the Association for Computational Linguistics: NAACL 2024, June 2024
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Comments Accepted by IJCNN 2024
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments 17 pages, 15 figures, published to ACM MobiCom'24
Journal ref The 30th Annual International Conference on Mobile Computing and Networking, 2024
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV
Journal ref In 2022 10th International Conference on Affective Computing and Intelligent Interaction (ACII) (pp. 1-8). IEEE
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments ICASSP2024 accepted
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
Comments Accepted at the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments Accepted at ICLR 2024. Code, dataset, and models are available at https://github.com/YuanGongND/ltu. The interactive demo is at https://huggingface.co/spaces/yuangongfdu/ltu
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Journal ref A. Vazquez-Romero and A. Gallardo-Antolin Entropy 22, no. 6: 688 (2020)
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Comments 10 pages, in Spanish, Tecniacústica
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments Australasian Conference on Robotics and Automation (ACRA). 2023
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI
专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS
Journal ref 16th International Symposium on CMMR, Future University Hakodate, Japan; Asia University, Japan; Nihon University, Japan; Laboratoire PRISM, Marseille, France, Nov 2023, Tokyo, France
专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
专题命中 音频语音多模态 :any-to-any(abstract);分类 eess.AS
Comments AAAI 2024 Demo, Codes: https://phonemehallucinator.github.io/
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS
Comments Accepted at ICASSP 2024
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
Comments 10 pages, 8 figures, SENTIRE'23 (ICDM 2023)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted to WACV 2024
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV
Comments Our code is available at https://github.com/talreiss/FACTOR
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV
Comments To be published in 37th Conference on Neural Information Processing Systems