StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
机构 * Meta AI ; New York University(纽约大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 15 pages, 3 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Meta AI ; New York University(纽约大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 15 pages, 3 figures
机构 * Yale University(耶鲁大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.MM
Comments 12 pages, 4 figures, 2 tables. Extends our earlier framework on hierarchical narrative graphs with a semantic normalization module
机构 * Universidad de Buenos Aires, Facultad de Ciencias Exactas y Naturales(布宜诺斯艾利斯大学,精确科学与自然学院) ; Institute of Engineering Sciences, Universidad de O’Higgins(工程科学研究所,奥希金斯大学) ; CONICET-UBA, Instituto de Ciencias de la Computacion (ICC)(CONICET-UBA,计算科学研究所) ; L3S Research Center, Leibniz Universität Hannover(L3S研究中心,汉诺威莱布尼茨大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW); 2nd Workshop on Neuromorphic Vision (NeVi)
机构 * Louisiana State University(路易斯安那州立大学) ; Northeastern University(东北大学) ; Yale University(耶鲁大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
Comments This paper will appear in CCS 2025
专题命中 视频多模态 :multimodal(abstract)