UniVTG: Towards Unified Video-Language Temporal Grounding
专题命中 视频理解 :video-language(title);分类 cs.CV
Comments Accepted by ICCV 2023. 16 pages, 10 figures, 13 tables. Code: https://github.com/showlab/UniVTG
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :video-language(title);分类 cs.CV
Comments Accepted by ICCV 2023. 16 pages, 10 figures, 13 tables. Code: https://github.com/showlab/UniVTG
专题命中 视频理解 :video understanding(title);分类 cs.MM
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments SRVU - ICCV' 2021 workshop
专题命中 视频理解 :video understanding(title);分类 cs.CV
专题命中 视频理解 :video understanding(title);分类 cs.CV
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments CVPR 2023
专题命中 视频理解 :video understanding(title);分类 cs.CV
专题命中 视频理解 :video understanding(title);分类 cs.CV
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Accepted by WACV'2022
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Accepted to ICML 2021
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Accepted to CVPR 2021(Oral). Project page: http://www.robots.ox.ac.uk/~vgg/research/tqn/
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments ECCV 2020, European Conference on Computer Vision
专题命中 视频理解 :video understanding(title);分类 cs.CV
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments Code and models are available at https://github.com/facebookresearch/video-long-term-feature-banks
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments under review
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments CVPR 2018 spotlight. The first two authors contributed equally to this paper
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments 6 pages, 5 figures, 3 tables
专题命中 视频理解 :video understanding(title);分类 cs.CV
Comments (20/03/2012)
Journal ref 9th IEEE International Conference on Advanced Video and Signal-Based Surveillance (AVSS 2012) (2012) 136 -142
机构 * Department of Computer Science, Temple University(Temple大学计算机科学系) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM
Comments Accepted to TMLR 2025 - Project page: https://amir-aghdam.github.io/act-align/
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV、cs.MM
Comments Accepted at the 30th International Conference on Multimedia Modeling (MMM 2024)
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV、cs.MM
Comments To appear in CVPR 2022
专题命中 视频理解 :video understanding(abstract,comments);long video(abstract);分类 cs.CV
Comments Accepted to EMNLP-23 TL;DR: Video understanding lags far behind NLP; LLMs excel in zero-shot. Our approach utilizes LLMs to verbalize videos, creating stories for zero-shot video understanding. This yields state-of-the-art results across five datasets, covering fifteen tasks
DualFact+: 一种用于过程视频理解的多模态事实验证框架
机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; Saarland Informatics Campus(萨尔兰信息学校区)
专题命中 视频理解 :video understanding(title)
AI总结 DualFact+通过双层多模事实验证框架,针对过程视频描述中的概念事实和上下文事实进行评估,揭示了多模态事实 grounding 的挑战。
Comments ACL 2026 Findings
专题命中 视频理解 :long video(title)
用于抑制视觉语言模型幻觉的维纳表示滤波
机构 * Tel Aviv University(特拉维夫大学)
专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。
GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。
Comments 4 figures, accepted to ACM MM 26'
WaveZip:用于视频令牌压缩的小波驱动时空解耦
机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) ; Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 针对长视频理解中视觉令牌计算成本高的问题,提出WaveZip框架,利用离散小波变换分离时空信号,无需特定任务训练,能集成到LVLMs提升推理效率,在长视频理解基准测试中表现优异。
Comments 13 pages, 10 figures
HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向
机构 * Tufts University(塔夫茨大学)
专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV
AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。
跟踪并描述任何运动:通过轨迹条件生成实现开放词汇时空字幕
机构 * Northeastern University(东北大学)
专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 研究提出TCAM框架,无需文本查询和区域提示,通过字幕感知重采样器在点粒度结合跟踪与语言,用现有分割注释训练,能描述视频中运动、定位时间及轨迹,优于密集视频字幕基线,匹配相关方法,为运动驱动视频理解提供新途径。