V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted to AAAI 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted to AAAI 2025
机构 * Southern University of Science and Technology(南方科技大学) ; Tencent Inc.(腾讯公司)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ACCV 2022
机构 * ByteDance(字节跳动)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to AAAI 2025
机构 * Université Paris Cité(巴黎Cité大学) ; University of Oxford(牛津大学) ; University of Turin(都灵大学) ; Universität Leipzig(莱比锡大学) ; Max Planck School of Cognition(马克斯·普朗克认知科学学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba group(阿里巴巴集团)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
专题命中 视频多模态 :multimodal(abstract)
Comments RecSys 2025 Industry Track