Spoken Moments: Learning Joint Audio-Visual Representations from Video Descriptions
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.CL、eess.AS
Comments To appear at CVPR 2021
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.CL、eess.AS
Comments To appear at CVPR 2021
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.MM、eess.AS
Comments AAAI'21
专题命中 音频语音多模态 :audio-visual(title,abstract)
Journal ref in IEEE Access, vol. 9, pp. 37431-37455, 2021
专题命中 音频语音多模态 :multimodal(title,abstract)
Journal ref Behaviour & Information Technology, 2020
专题命中 音频语音多模态 :multimodal(title,abstract)
专题命中 音频语音多模态 :cross-modal(title);multimodal(abstract)
Journal ref Proceedings of the International Conference on New Interfaces for Musical Expression, 2017
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments Preprint
专题命中 音频语音多模态 :multi-modal(title,abstract)
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments Presented at the CHI 2020 Designing Interactions for the Ageing Populations Addressing Global Challenges Workshop
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.CL、eess.AS
Comments Accepted by BMVC 2020. More experiments. Code: https://github.com/v-iashin/bmt Project page: https://v-iashin.github.io/bmt
专题命中 音频语音多模态 :multimodal(title,abstract)
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments The 13th International Conference on Educational Data Mining (EDM 2020), 2020
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments 12 pages, 3 figures, 3 tables
Journal ref IEEE Transactions on Visualization and Computer Graphics. January 2020
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments NIME 2020 poster presentation. 6 pages
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments 15 pages, 9 figures, 3 tables
Journal ref IEEE Transactions on Visualization and Computer Graphics. March 2020
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract)
Comments 15 pages, 28 figures, 5 tables, 5 equations
专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV、cs.MM、eess.AS
Comments WACV2020. Project video and code are available at https://jianrenw.github.io/AlignNet
专题命中 音频语音多模态 :audio-visual(title);multi-modal(abstract)
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments To appear in ACM CHI 2020 Conference on Human Factors in Computing Systems; 13 pages (10 content + 3 references); 4 Figures, 1 Table
专题命中 音频语音多模态 :multimodal(title,abstract)
专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV、cs.CL、eess.AS
Comments 5 pages, 1 figure, 4 tables; Interspeech 2019 with the following edits: 1) Loss and accuracy upon convergence were accidentally reported from an older model. Now updated with model described throughout the paper. All other results remain unchanged. 2) Max true offset in the training data corrected from 179ms to 1789ms. 3) Detectability "boundary/range" renamed to detectability "thresholds"
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments Submitted to IROS 2019
专题命中 音频语音多模态 :multi-modal(title,abstract)
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments 6 pages, 14 figures, 2 tables. This paper is accepted by NIME 2019(New Interface for Musical Expression)
专题命中 音频语音多模态 :multimodal(title,abstract)
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments 4 pages
专题命中 音频语音多模态 :multimodal(title,abstract)
专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :multimodal(title,abstract)
Comments 4 pages, 5 figures, ACM Richard Tapia Conference, Atlanta, 2017
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract)
Journal ref Informatik Spectrum, Springer volume 40,No. 6. 2017