LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering
专题命中 视频问答 :long video(abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频问答 :long video(abstract);分类 cs.CV
机构 * MedVisAI Lab(MedVisAI实验室) ; National University of Singapore(新加坡国立大学) ; Nankai University(南开大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科谦医学院)
专题命中 视频问答 :video understanding(abstract);分类 cs.CV