Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV、cs.MM
Comments Under peer review
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV、cs.MM
Comments Under peer review
将视频搜索为树:用于有基础的长视频问答的自校正智能体
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Sony(索尼)
专题命中 视频问答 :long video(title,abstract);分类 cs.CV
AI总结 研究有基础的长视频问答问题,提出VideoTreeSearch框架,通过构建自适应时间树及可学习的离散操作让智能体导航,经监督微调与强化学习训练,在多个基准测试中表现出色,证明自校正分层搜索是关键机制。
NeMo:视频语言理解中的蒙太奇之针
机构 * The Chinese University of Hong Kong(香港中文大学) ; Phoenix TV(凤凰电视台) ; Stanford University(斯坦福大学) ; University of Liverpool(利物浦大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
AI总结 为评估视频大语言模型时间理解能力,提出蒙太奇之针(NeMo)任务,开发自动数据生成管道并构建NeMoBench基准,能生成高质量数据,评估了20个模型,展现其能力与局限。
迈向稀疏视频理解与推理
机构 * Northwestern University(西北大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Dolby Laboratories(杜比实验室)
专题命中 视频问答 :video understanding(title);video reasoning(abstract);分类 cs.CV
AI总结 提出一种多轮视频问答代理,通过稀疏帧选择、状态摘要和早期停止机制,在减少帧数和令牌数的同时提升准确率。
Comments Accepted to CVPR 2026. Project page: https://sparsevideounderstanding.github.io
视频主动感知:基于视觉-语言模型的高效推理时长视频理解
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MIT(麻省理工学院)
专题命中 视频问答 :video understanding(title);video generation(abstract);分类 cs.CV
AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。
Comments ICCV 2025 workshop
基于簇的时空掩码用于高效的视频-语言预训练
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。
Comments Accepted by CVPR 2026
V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视频问答 :video-language(title);video understanding(abstract);分类 cs.CV
AI总结 V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。
Comments Project Page: https://vlm-reasoning.github.io/V2P-Bench/
Video-R4:通过视觉沉思强化文本丰富的视频推理
机构 * University of Rochester(罗切斯特大学) ; Sony Group Corporation(索尼集团) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
AI总结 Video-R4通过视觉沉思机制提升文本丰富视频的推理能力,采用多阶段学习框架实现像素基础的多模态推理。
专题命中 视频问答 :video understanding(title);long video(abstract);分类 cs.CV
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) ; The University of Hong Kong(香港大学) ; School of Software, Northwestern Polytechnical University(软件学院,西北工业大学) ; Unmanned System Research Institute, Northwestern Polytechnical University(无人系统研究院,西北工业大学)
专题命中 视频问答 :video understanding(title,abstract);分类 cs.CV
Comments ACM MM 2025
机构 * Sun Yat-sen University(中山大学) ; Lanzhou University(兰州大学) ; University of Hong Kong(香港大学) ; Hefei University of Technology(合肥工业大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
机构 * School of Computer Science, Duy Tan University(计算机科学学院,杜益坦大学) ; School of Computer Sciences, Universiti Sains Malaysia(计算机科学学院,马来亚大学)
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments CVPR 2025 camera-ready version
专题命中 视频问答 :video understanding(title);video reasoning(abstract);分类 cs.CV
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments Accept to CVPR 2025, Project page: https://github.com/JiuTian-VL/LION-FS
专题命中 视频问答 :video language model(title);video-language(abstract);分类 cs.CV
专题命中 视频问答 :video understanding(title,abstract);分类 cs.CV
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments Accepted to ECCV 2024
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments ECCV 2024
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments under review
专题命中 视频问答 :long video(title,abstract);分类 cs.CV
Comments Published in BMVC 2023
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments 16 pages, 9 figures, code is available at https://github.com/RenShuhuai-Andy/TESTA
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments 13 pages, 6 figures, accepted by EMNLP 2022 main conference
专题命中 视频问答 :video-language(title,abstract);分类 cs.CV
Comments 18 pages. 11 figures. Code: https://github.com/showlab/all-in-one
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
Comments Accepted to ICCV 2021 Workshops
专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2021
机构 * University of Trento(特伦托大学) ; Gran Sasso Science Institute(格兰萨索科学研究所) ; University of Essex(埃塞克斯大学) ; University of Bath(巴斯大学)
专题命中 视频问答 :video language model(title,abstract)
先构建图!通过场景图实现长视频第一人称视频推理
机构 * Politecnico di Milano(米兰理工大学) ; Bocconi University(博科尼大学)
专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);long video(abstract);分类 cs.CV
AI总结 提出利用第一人称场景图(EgoSGs)将长视频压缩为紧凑文本表示,在保持语义丰富性的同时大幅减少输入长度,使多模态大模型能在令牌预算内高效推理,在HD-EPIC VQA上取得最优结果。
推理前的感知:面向视频理解与问答的动态隐式推理
机构 * Rice University(莱斯大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视频问答 :video understanding(title);分类 cs.CV
AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。