AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments CVPR 2023
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted in ICASSP 2023
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments 12 pages, 3 figures. Proceedings of the 13th Workshop on Ontology Design and Patterns, edited by V. Svátek et al., WOP, 2022
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
Comments IEEE/CVF CVPR 2023
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments ICASSP 2023
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、eess.AS
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 8 pages, 5 figures, 2 tables
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS
Comments 12 pages, incl. 2 pages appendix
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Accepted at ICASSP 2023. Demo available: https://github.com/joannahong/Lip-to-Speech-Synthesis-in-the-Wild
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Published in Signal Processing Letters. Code at https://github.com/YuanGongND/uavm
Journal ref IEEE Signal Processing Letters, vol. 29, pp. 2437-2441, 2022
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments Camera-ready version. Website: https://soundspaces.org. Project page: https://vision.cs.utexas.edu/projects/soundspaces2
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments submitted to Advanced Robotics
Journal ref Advanced Robotics, 30:11-12, 706-728, 2016
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments Accepted by EURASIP Journal on Audio Speech and Music Processing
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments 8 pages, 4 figures, ICMI 2022
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
Comments Accepted at ECCV2022
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.MM、eess.AS
Comments arXiv admin note: text overlap with arXiv:2108.03543
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
Comments 13 pages for peer review. Code will be released at https://github.com/xaCheng1996/VFD
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at IJCAI-ECAI 2022 (Survey Track) - Editorial Feedback Revised, 9 pages (7 main + 2 reference pages)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、eess.AS
Comments CVPR 2022. Project page at https://rowanzellers.com/merlotreserve
专题命中 音频语音多模态 :image-text(abstract);分类 cs.CV、cs.CL、eess.AS
Comments Accepted to NAACL 2022. Our code is available at https://github.com/zhaoyanpeng/vipant
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
Comments In Findings of NAACL 2022. arXiv admin note: substantial text overlap with arXiv:2010.08923
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
Comments 46 pages, 5 figures. Pre-print version of the introduction to the book "Sonic Interactions in Virtual Environments" in press for Springer's Human-Computer Interaction Series, Open Access license. The pre-print editors' copy of the book can be found at https://vbn.aau.dk/en/publications/sonic-interactions-in-virtual-environments - full book info: https://sive.create.aau.dk/index.php/sivebook/
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS
Comments Published at NeurIPS 2021
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS
Comments 6 pages, 5 figures, ICPR (International Conference on Pattern Recognition) 2022
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS