VideoNSA: Native Sparse Attention Scales Video Understanding
VideoNSA:原生稀疏注意力扩展视频理解
专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化
Comments ICLR 2026
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
VideoNSA:原生稀疏注意力扩展视频理解
专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化
Comments ICLR 2026
少即是多:基于标签的程序性和教学视频摘要
机构 * University of Tübingen(图宾根大学) ; Vellore Institute of Technology(维洛雷理工学院) ; Brown University(布朗大学)
专题命中 视频理解 :long video(abstract);分类 cs.CV
AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。
Comments 22 pages, 6 figures