SASRA: Semantically-aware Spatio-temporal Reasoning Agent for Vision-and-Language Navigation in Continuous Environments
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
Comments 10 pages, 4 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
Comments 10 pages, 4 figures
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM
Comments ACM MM Oral paper
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 5 pages, 1 figure
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments 11 pages, 6 figures
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted for ICRA 2021
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments ACL 2021
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments This library is available at https://github.com/pykale/pykale
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 9 pages, This paper is accepted by ICMR 2021
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments This paper is accepted by NAACL'21
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI
Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2020
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence. Code and data will be available at https://github.com/danieljf24/hybrid_space. Conference version: arXiv:1809.06181
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments 16 Pages, 8 Figures, 4 Tables, +Supp Mats
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted at AAAI 2021
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments 21 pages, 6 figures, 3 tables. arXiv admin note: substantial text overlap with arXiv:2011.07658
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI
Comments 10 pages, 4 figures
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments 20+17 pages, 33 figures; added appendix with additional language results
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments arXiv admin note: text overlap with arXiv:1910.11482
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL
Comments Accepted at ACL 2020 (Short Paper)
Journal ref Association for Computational Linguistics (2020) 5842-5848
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments To appear at ACL 2020
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted to ICIP 2020
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments Published in IEEE Transactions on Multimedia
Journal ref J. Li, Y. Wong, Q. Zhao and M. S. Kankanhalli, "Video Storytelling: Textual Summaries for Events," in IEEE Transactions on Multimedia, 2019
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments CVPR20 camera-ready including appendix
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments This is a research report done during master's studies
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、eess.AS
Comments Accepted for the Fifth International Workshop on Egocentric Perception, Interaction and Computing (EPIC) at the International Conference on Computer Vision (ICCV) 2019
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM