arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2412.12075 2024-12-17 cs.CV 88%

CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding

Guo Chen, Yicheng Liu, Yifei Huang, Yuping He, Baoqi Pei, Jilan Xu, Yali Wang, Tong Lu, Limin Wang

专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16978 2026-06-17 cs.CV 版本更新 85%

A Benchmark for Omni-Modal Reasoning in Long Videos

长视频全模态推理基准

Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Jinxing Zhou, Sahal Shaji Mullappilly, Mohammad Almansoori, Noor Ahsan, Beknur Kalmakhanbet, Sambal Shikhar, Rishabh Lalla, Jean Lahoud, Mariette Awad, Fahad Shahbaz Khan, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) American University of Beirut(贝鲁特美国大学) Linköping University(利尔贝里大学)

专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04051 2025-04-08 cs.CV cs.AI cs.LG 85%

Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models

Xuyang Guo, Zekai Huang, Jiayan Huo, Yingyu Liang, Zhenmei Shi, Zhao Song, Jiahao Zhang

专题命中 视频数据与评测 :text-to-video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15542 2024-08-29 cs.CV cs.AI cs.MM 84%

Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input

Jiajun Liu, Yibing Wang, Hanghang Ma, Xiaoping Wu, Xiaoqi Ma, Xiaoming Wei, Jianbin Jiao, Enhua Wu, Jie Hu

专题命中 视频数据与评测 :video-language(title);video understanding(abstract);long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25905 2026-06-25 cs.CV 新提交 83%

SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集

Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang, Alyssa M. Hardin, Ahmad M. Hider, Yayuan Li, Jing Bi, Susan Liang, Chenliang Xu, Donald S. Likosky, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Edinburgh(爱丁堡大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) University of Colorado(科罗拉多大学) University of Rochester(罗切斯特大学) Michigan Medicine(密歇根医学)

专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08412 2026-05-12 cs.CV 83%

SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

SYNCR: 一个具有合成接地的跨视频推理基准

Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami

机构 * New York University(纽约大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 SYNCR通过合成数据评估多视频推理能力,发现现有模型在物理空间推理上表现不足,参数扩展和训练后优化能提升时间对齐能力,但无法可靠解决细粒度物理跟踪和全局空间合成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13928 2026-02-05 cs.CV cs.IR 83%

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24952 2026-01-15 cs.CV 83%

Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning

超越最后一帧:面向生成视频推理的过程感知评估

Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Wayne Xin Zhao, Minghui Qiu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Information, Renmin University of China(中国人民大学信息学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ByteDance(字节跳动)

专题命中 视频数据与评测 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出VIPER基准和POC@r指标,用于评估生成视频推理中过程与结果的一致性,揭示现有模型在推理能力上的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12263 2025-12-02 cs.CV cs.AI 83%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 视频数据与评测 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11002 2025-11-17 cs.CV 83%

EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation

Zongyang Qiu, Bingyuan Wang, Xingbei Chen, Yingqing He, Zeyu Wang

专题命中 视频数据与评测 :video understanding(title);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 15 pages, 12 figures. Accepted as an Oral presentation at AAAI 2026. For code and dataset, see https://zane-zyqiu.github.io/EmoVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00399 2025-08-15 cs.CV 83%

iSafetyBench: A video-language benchmark for safety in industrial environment

Raiyaan Abdullah, Yogesh Singh Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

Comments Accepted to VISION'25 - ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09105 2025-07-02 cs.CV cs.AI 83%

VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models

Chenglin Li, Qianglong Chen, Zhi Li, Feng Tao, Yin Zhang

机构 * Zhejiang University(浙江大学)

专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04983 2025-06-06 cs.CV 83%

TextVidBench: A Benchmark for Long Video Scene Text Understanding

Yangyang Zhong, Ji Qi, Yuan Yao, Pengxin Luo, Yunfeng Yan, Donglian Qi, Zhiyuan Liu, Tat-Seng Chua

专题命中 视频数据与评测 :long video(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24346 2025-06-02 cs.CV 83%

VUDG: A Dataset for Video Understanding Domain Generalization

Ziyi Wang, Zhi Gao, Boxuan Yu, Zirui Dai, Yuxiang Song, Qingyuan Lu, Jin Chen, Xinxiao Wu

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学)

专题命中 视频数据与评测 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04946 2025-05-09 cs.CV cs.AI cs.CL cs.LG 83%

T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models

Xuyang Guo, Jiayan Huo, Zhenmei Shi, Zhao Song, Jiahao Zhang, Jiale Zhao

机构 * Guilin University of Electronic Technology(桂林电子科技大学) University of Arizona(亚利桑那大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) Arizona State University(亚利桑那州立大学)

专题命中 视频数据与评测 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16718 2025-04-28 cs.CV cs.AI 83%

Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification

S P Sharan, Minkyu Choi, Sahil Shah, Harsh Goel, Mohammad Omama, Sandeep Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频数据与评测 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10889 2025-04-01 cs.CV cs.AI cs.LG 83%

VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment

Darshana Saravanan, Varun Gupta, Darshan Singh, Zeeshan Khan, Vineet Gandhi, Makarand Tapaswi

专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Project Page, see https://katha-ai.github.io/projects/velociti

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10867 2025-03-21 cs.CV cs.AI 83%

ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models

Vipula Rawte, Sarthak Jain, Aarush Sinha, Garv Kaushik, Aman Bansal, Prathiksha Rumale Vishwanath, Samyak Rajesh Jain, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha, Amit P. Sheth, Amitava Das

专题命中 视频数据与评测 :text-to-video(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14500 2025-03-18 cs.CV 83%

ViLLa: Video Reasoning Segmentation with Large Language Model

Rongkun Zheng, Lu Qi, Xi Chen, Yi Wang, Kun Wang, Yu Qiao, Hengshuang Zhao

专题命中 视频数据与评测 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

Comments 15 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05503 2025-03-06 cs.CV cs.AI 83%

A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction

Yongfan Chen, Xiuwen Zhu, Tianyu Li

专题命中 视频数据与评测 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07704 2024-12-11 cs.CV 83%

GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning

Yicheng Wang, Zhikang Zhang, Jue Wang, David Fan, Zhenlin Xu, Linda Liu, Xiang Hao, Vimal Bhat, Xinyu Li

专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04998 2024-11-08 cs.CV cs.AI cs.LG 83%

HourVideo: 1-Hour Video-Language Understanding

Keshigeyan Chandrasegaran, Agrim Gupta, Lea M. Hadzic, Taran Kota, Jimming He, Cristóbal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, Li Fei-Fei

专题命中 视频数据与评测 :video-language(title,abstract);long video(abstract);分类 cs.CV

Comments NeurIPS 2024 Datasets and Benchmarks Track; 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18522 2024-10-03 cs.CV cs.CL 83%

ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation

Shenghai Yuan, Jinfa Huang, Yongqi Xu, Yaoyang Liu, Shaofeng Zhang, Yujun Shi, Ruijie Zhu, Xinhua Cheng, Jiebo Luo, Li Yuan

专题命中 视频数据与评测 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments NeurIPS D&B 2024 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15754 2024-07-23 cs.CV cs.CL cs.LG 83%

LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding

Haoning Wu, Dongxu Li, Bei Chen, Junnan Li

专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16338 2024-06-25 cs.CV 83%

VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

Yuxuan Wang, Yueqian Wang, Dongyan Zhao, Cihang Xie, Zilong Zheng

专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03690 2024-05-10 cs.CV 83%

How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs

Muhammad Uzair Khattak, Muhammad Ferjad Naeem, Jameel Hassan, Muzammal Naseer, Federico Tombari, Fahad Shahbaz Khan, Salman Khan

专题命中 视频数据与评测 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07022 2023-11-14 cs.CL cs.AI cs.CV 83%

ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models

Ilker Kesen, Andrea Pedrotti, Mustafa Dogan, Michele Cafagna, Emre Can Acikgoz, Letitia Parcalabescu, Iacer Calixto, Anette Frank, Albert Gatt, Aykut Erdem, Erkut Erdem

专题命中 视频数据与评测 :video-language(title,abstract);video language model(abstract);分类 cs.CV

Comments Preprint. 48 pages, 22 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04362 2023-06-08 cs.CV cs.CL 83%

Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Dataset for Pre-training and Benchmarks

Haiyang Xu, Qinghao Ye, Xuan Wu, Ming Yan, Yuan Miao, Jiabo Ye, Guohai Xu, Anwen Hu, Yaya Shi, Guangwei Xu, Chenliang Li, Qi Qian, Maofei Que, Ji Zhang, Xiao Zeng, Fei Huang

专题命中 视频数据与评测 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03434 2026-01-08 cs.LG 82%

VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding

VNU-Bench:多源多模态新闻视频理解的基准数据集

Zibo Liu, Muyang Li, Zhe Jiang, Shigang Chen

机构 * University of Florida(佛罗里达大学)

专题命中 视频数据与评测 :video understanding(title,abstract);video reasoning(abstract)

AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06942 2024-01-05 cs.CV 81%

InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation

Yi Wang, Yinan He, Yizhuo Li, Kunchang Li, Jiashuo Yu, Xin Ma, Xinhao Li, Guo Chen, Xinyuan Chen, Yaohui Wang, Conghui He, Ping Luo, Ziwei Liu, Yali Wang, Limin Wang, Yu Qiao

专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);text-to-video(abstract);video-language(abstract)

Comments Data and Code: https://github.com/OpenGVLab/InternVideo/tree/main/Data/InternVid

详情

展开后加载摘要…

URL PDF HTML 收藏