StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification
专题命中 视频多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
机构 * Beijing Institute of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Chinese Academy of Sciences(中国科学院) ; Air Force Hospital of Southern Theater Command of PLA(中国人民解放军南部战区空军医院) ; Shenzhen Traditional Chinese Medicine Hospital(深圳中医药医院)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments 19 pages, 8 figures, 7 tables
机构 * Korean Broadcasting System(KBS)(韩国广播系统) ; Department of Artificial Intelligence(人工智能系) ; Konyang University(全南大学)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
机构 * ByteDance Inc.(字节跳动公司)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * UC Berkeley(加州大学伯克利分校) ; Waymo LLC(Waymo公司) ; Cornell University(康奈尔大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2025; Project website: s4-driver.github.io
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; The University of Hong Kong(香港大学) ; Xi’an JiaoTong University(西安交通大学)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
Comments 69 pages, 66 figures, accepted by ACL 2025
机构 * East China Normal University(东华大学)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL
机构 * CSE, HKUST(香港科技大学计算机科学与工程学系) ; Apple(苹果公司) ; UCLA(加利福尼亚大学洛杉矶分校)
专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICLR 2025
机构 * Sun Yat-sen University(中山大学) ; Shenzhen Institute of Advanced Technology(深圳先进技术研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted by CVPR 2025
机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) ; School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments IEEE Transactions on Image Processing 2024
专题命中 视频多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.MM
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.MM
Comments Accepted by AAAI 2025
专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
Comments 7 pages, 4 figures
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)AI部门)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
Comments 4 Figure; 2 Table
专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted at ICME 2024 as poster presentation. arXiv admin note: text overlap with arXiv:2306.14392
专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
Comments Preprint. Work in progress
专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
专题命中 视频多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL
Comments Accepted by IEEE Access
Journal ref in IEEE Access, vol. 11, pp. 51229-51240, 2023
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Published in Transactions on Machine Learning Research. Previous version accepted to Foundation Models for Decision Making Workshop at NeurIPS 2022
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted to TPAMI 2023
专题命中 视频多模态 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR 2023
专题命中 视频多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Journal ref 2023 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW)
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
Comments 12 pages; accepted by IEEE TMM
Journal ref IEEE Transactions on Multimedia 2021
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments EACL 2023
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI