CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
Comments 14 pages, 9 figures
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
Comments 14 pages, 9 figures
长视频全模态推理基准
机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; American University of Beirut(贝鲁特美国大学) ; Linköping University(利尔贝里大学)
专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。
专题命中 视频数据与评测 :text-to-video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV
专题命中 视频数据与评测 :video-language(title);video understanding(abstract);long video(abstract);分类 cs.CV、cs.MM
SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集
机构 * University of Michigan(密歇根大学) ; University of Edinburgh(爱丁堡大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; University of Colorado(科罗拉多大学) ; University of Rochester(罗切斯特大学) ; Michigan Medicine(密歇根医学)
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。
SYNCR: 一个具有合成接地的跨视频推理基准
机构 * New York University(纽约大学)
专题命中 视频数据与评测 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 SYNCR通过合成数据评估多视频推理能力,发现现有模型在物理空间推理上表现不足,参数扩展和训练后优化能提升时间对齐能力,但无法可靠解决细粒度物理跟踪和全局空间合成问题。
LoVR:一种多模态背景下长视频检索的基准
机构 * East China Normal University Shanghai China ; Peking University \& Zhongguancun Academy Beijing China ; Huazhong University of Science ; Beihang University Beijing China ; Peking University Beijing China ; East China Normal University ; Peking University \& Zhongguancun Academy ; Beihang University ; Peking University
专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。
超越最后一帧:面向生成视频推理的过程感知评估
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; School of Information, Renmin University of China(中国人民大学信息学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ; ByteDance(字节跳动)
专题命中 视频数据与评测 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV
AI总结 本文提出VIPER基准和POC@r指标,用于评估生成视频推理中过程与结果的一致性,揭示现有模型在推理能力上的不足。
Comments Work in progress
CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准
专题命中 视频数据与评测 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。
Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid
专题命中 视频数据与评测 :video understanding(title);video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments 15 pages, 12 figures. Accepted as an Oral presentation at AAAI 2026. For code and dataset, see https://zane-zyqiu.github.io/EmoVid
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
Comments Accepted to VISION'25 - ICCV 2025 workshop
机构 * Zhejiang University(浙江大学)
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);分类 cs.CV
机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ; Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学)
专题命中 视频数据与评测 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
机构 * Guilin University of Electronic Technology(桂林电子科技大学) ; University of Arizona(亚利桑那大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of California, Berkeley(加州大学伯克利分校) ; Arizona State University(亚利桑那州立大学)
专题命中 视频数据与评测 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频数据与评测 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV
Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR) 2025
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
Comments Accepted to CVPR 2025. Project Page, see https://katha-ai.github.io/projects/velociti
专题命中 视频数据与评测 :text-to-video(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 视频数据与评测 :video reasoning(title,abstract);long video(abstract);分类 cs.CV
Comments 15 pages,7 figures
专题命中 视频数据与评测 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 视频数据与评测 :video-language(title,abstract);long video(abstract);分类 cs.CV
Comments NeurIPS 2024 Datasets and Benchmarks Track; 28 pages
专题命中 视频数据与评测 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
Comments NeurIPS D&B 2024 (Spotlight)
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
Comments 29 pages
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 视频数据与评测 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
Comments Technical report
专题命中 视频数据与评测 :video-language(title,abstract);video language model(abstract);分类 cs.CV
Comments Preprint. 48 pages, 22 figures, 10 tables
专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
Comments Working in progress
VNU-Bench:多源多模态新闻视频理解的基准数据集
机构 * University of Florida(佛罗里达大学)
专题命中 视频数据与评测 :video understanding(title,abstract);video reasoning(abstract)
AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。
专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);text-to-video(abstract);video-language(abstract)
Comments Data and Code: https://github.com/OpenGVLab/InternVideo/tree/main/Data/InternVid