Semantic Frame Aggregation-based Transformer for Live Video Comment Generation
机构 * IIIT-Delhi, India(德里印度理工学院) ; Grenoble INP – Ensimag, France(法国格勒诺布尔INP–Ensimag)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * IIIT-Delhi, India(德里印度理工学院) ; Grenoble INP – Ensimag, France(法国格勒诺布尔INP–Ensimag)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
机构 * Department of Electrical and Computer Engineering, King Abdullah University of Science and Technology (KAUST)(电气与计算机工程系,国王 Abdullah 科学与技术大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
机构 * GM Cruise LLC
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments technical report, 23 pages, NeurIPS 2025 poster
专题命中 视频多模态 :multimodal(abstract)
专题命中 视频多模态 :cross-modal(abstract)