Generalized zero-shot audio-to-intent classification
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments 13 pages, 6 figures, 5 tables
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 13 figures
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments Withdrawn at the request of industry research collaborators, per contract agreement
专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.CL、eess.AS
Comments Accepted to ASRU 2023
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM、eess.AS
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS
Comments 5 pages
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
Comments Voice-Text fusion input; The first work of audio driven diffusion model. arXiv admin note: text overlap with arXiv:2303.04585
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI
Comments 7 pages, 4 figures, 2 tables, Published with International Journal of Computer Science Trends and Technology (IJCST)
Journal ref International Journal of Computer Science Trends and Technology (IJCST) V11(4): Page(109-115) Jul - Aug 2023. ISSN: 2347-8578
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments ICCV 2023. Project site: https://ificl.github.io/SLfM/
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS
Comments Accepted by Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies (ACM IMWUT/UbiComp 2023)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS
Comments 17 pages, 8 figures, 7 tables, Published in Neurocomputing
Journal ref Neurocomputing (2023); Volume 545; 126271
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments the research paper is still in progress
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments Accepted by ICML 2023 Workshop, 6 pages, 3 figures
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS
Comments Interspeech 2023
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS
Comments Accepted by WASPAA 2023. Demo: https://salu133445.github.io/clipsonic/
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS
Comments Accepted to EUSIPCO 2023
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.MM、eess.AS
Comments Preprint for APSIPA2023
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS
Comments ICML 2023
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS
Comments accepted by ICASSP 2023
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS
Comments Accepted camera-ready version for INTERSPEECH 2023
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS
Comments accepted as oral and top 3% paper by ICASSP 2023
Journal ref ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2023, 1-5
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS
Comments CVPR 2023 (Highlight). Project page: https://samuelpclarke.com/realimpact/
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
Comments Accepted to ACL2023 (Oral)