Unified speech and gesture synthesis using flow matching
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS
Comments 5 pages, 1 figure. Final version, accepted to IEEE ICASSP 2024
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS
Comments 5 pages, 1 figure. Final version, accepted to IEEE ICASSP 2024
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS
Comments ICASSP 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments AAAI 2024. Demo page: https://v2a-mapper.github.io/
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by NeurIPS 2023
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 eess.AS
Comments Proceedings of the IEEE 6th International Conference on Multimedia Information Processing and Retrieval (MIPR)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted by IJCAI 2023
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
Comments Need to supplement more detailed experiments
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments ICASSP 2023
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 eess.AS
Comments Accepted by ACL 2023 (Main Conference)
专题命中 音频语音多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2112.00007
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments CVPR2023 Camera-Ready. Project Page: https://doubiiu.github.io/projects/codetalker/, Code: https://github.com/Doubiiu/CodeTalker
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments 7 pages, 1 figure, 3 tables, accepted to the 2nd Workshop and Competition on Affective Behavior Analysis In-the-Wild (ABAW2)
Journal ref 2021 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 eess.AS
Comments 5 pages
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Submitted: IEEE Transactions on Multimedia. arXiv admin note: substantial text overlap with arXiv:2112.10483
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS
Comments AAAI 2022
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted at CVPR 2022
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted to CVPR 2022
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 eess.AS
Comments Erratum: Due to a bug in the evaluation script, the correct average distance (aD) metric is here reported in yellow. The analysis remains unchanged from the original paper as the trend between the old and new measures are perfectly monotonic. The bug was caused by an incorrect normalization factor
Journal ref IEEE 23rd International Workshop on Multimedia Signal Processing (MMSP), 2021
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
Comments 19 pages, 11 figures
Journal ref Published in Expert Systems With Applications, 2021
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 eess.AS
Journal ref Frontiers in Computer Science, 08 April 2021
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV
Comments Accepted to BMVC2021. Project page: https://sites.google.com/view/bmvc2021stm
专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV