arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2502.10810 2025-11-18 cs.CV 79%

SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding

Zhenyu Yang, Yuhang Hu, Zemin Du, Dizhan Xue, Shengsheng Qian, Jiahong Wu, Fan Yang, Weiming Dong, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Zhengzhou University(郑州大学) ShanghaiTech University(上海科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments ICLR 2025 Accepted (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07250 2025-11-14 cs.CV cs.AI 79%

MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs

Tianhao Peng, Haochen Wang, Yuanxing Zhang, Zekun Wang, Zili Wang, Gavin Chang, Jian Yang, Shihao Li, Yanghai Wang, Xintao Wang, Houyi Li, Wei Ji, Pengfei Wan, Steven Huang, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) CASIA(中国科学院自动化研究所) Kuaishou Technology(快手科技) M-A-P

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21776 2025-10-23 cs.CV 79%

Video-R1: Reinforcing Video Reasoning in MLLMs

Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Junfei Wu, Xiaoying Zhang, Benyou Wang, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学多模态实验室) CUHK (SZ)(香港中文大学(深圳)) Tsinghua University(清华大学) UCAS(中国科学院大学) CUHK HCCL(香港中文大学高性能计算实验室)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

Comments NeurIPS 2025, Project page: https://github.com/tulerfeng/Video-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13042 2025-10-16 cs.CV cs.AI 79%

SeqBench: Benchmarking Sequential Narrative Generation in Text-to-Video Models

Zhengxu Tang, Zizheng Wang, Luning Wang, Zitao Shuai, Chenhao Zhang, Siyu Qian, Yirui Wu, Bohao Wang, Haosong Rao, Zhenyu Yang, Chenwei Wu

机构 * University of Michigan(密歇根大学) Northeastern University(东北大学) University of Washington(华盛顿大学) Harvard University(哈佛大学) Beijing Jiaotong University(北京交通大学) University of Rochester(罗切斯特大学) School of Earth Sciences(地球科学学院)

专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07249 2025-10-14 cs.CV 79%

TalkCuts: A Large-Scale Dataset for Multi-Shot Human Speech Video Generation

Jiaben Chen, Zixin Wang, Ailing Zeng, Yang Fu, Xueyang Yu, Siyuan Cen, Julian Tanke, Yihang Chen, Koichi Saito, Yuki Mitsufuji, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿姆赫斯特分校) Sony AI(索尼人工智能) UC San Diego(加州大学圣地亚哥分校)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://talkcuts.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08559 2025-10-10 cs.CV cs.AI 79%

SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models

Andong Deng, Taojiannan Yang, Shoubin Yu, Lincoln Spencer, Mohit Bansal, Chen Chen, Serena Yeung-Levy, Xiaohan Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Stanford University(斯坦福大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07550 2025-10-10 cs.CV cs.AI 79%

TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility

Saman Motamed, Minghao Chen, Luc Van Gool, Iro Laina

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07441 2025-10-10 cs.CV 79%

DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis

Nithin C. Babu, Aniruddha Mahapatra, Harsh Rangwani, Rajiv Soundararajan, Kuldeep Kulkarni

机构 * Indian Institute of Science(印度科学研究院) Adobe Research(Adobe研究)

专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV

Comments Preprint. Under review. 26 pages, 11 figures, 11 tables. Access the project page in https://nithincbabu7.github.io/DynamicEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26555 2025-10-01 cs.CV 79%

Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation

Agneet Chatterjee, Rahim Entezari, Maksym Zhuravinskyi, Maksim Lapin, Reshinth Adithyan, Amit Raj, Chitta Baral, Yezhou Yang, Varun Jampani

机构 * Stability AI Arizona State University(亚利桑那州立大学) Google DeepMind(谷歌DeepMind)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments NeurIPS 2025. Project Page : https://stable-cinemetrics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19951 2025-09-30 cs.CV cs.AI 79%

Audio-centric Video Understanding Benchmark without Text Shortcut

Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) ByteDance(字节跳动)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments Accepted for publication in the Proceedings of EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04817 2025-09-03 cs.CV 79%

LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering

Hongjie Zhang, Lu Dong, Yi Liu, Yifei Huang, Yali Wang, Limin Wang, Yu Qiao

机构 * OpenGVLab, Shanghai AI Laboratory, China(OpenGVLab,上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Honor Device Co.,Ltd(荣耀设备有限公司) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Nanjing University(南京大学)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00484 2025-09-03 cs.CV cs.AI 79%

VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding

Zhihong Zhang, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xinzhi Wang, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments https://videorewardbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14812 2025-08-21 cs.CV 79%

Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives

Haoyu Zhao, Jiaxi Gu, Shicong Wang, Xing Zhang, Hang Xu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21755 2025-08-21 cs.CV 79%

VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness

Dian Zheng, Ziqi Huang, Hongbo Liu, Kai Zou, Yinan He, Fan Zhang, Lulu Gu, Yuanhan Zhang, Jingwen He, Wei-Shi Zheng, Yu Qiao, Ziwei Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments Equal contributions from first two authors. Project page: https://vchitect.github.io/VBench-2.0-project/ Code: https://github.com/Vchitect/VBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16867 2025-08-19 cs.CV 79%

ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering

Kaisi Guan, Zhengfeng Lai, Yuchong Sun, Peng Zhang, Wei Liu, Kieran Liu, Meng Cao, Ruihua Song

机构 * Renmin University of China(中国人民大学) Apple(苹果公司)

专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV

Comments International Conference on Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18923 2025-08-14 cs.CV 79%

Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models

Meng Cao, Pengfei Hu, Yingyao Wang, Jihao Gu, Haoran Tang, Haoze Zhao, Chen Wang, Jiahua Dong, Wangbo Yu, Ge Zhang, Jun Song, Xiang Li, Bo Zheng, Ian Reid, Xiaodan Liang

专题命中 视频数据与评测 :video language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07554 2025-08-12 cs.MM 79%

FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding

Xusheng He, Wei Liu, Shanshan Ma, Qian Liu, Chenghao Ma, Jianlong Wu

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00144 2025-08-04 cs.CV 79%

World Consistency Score: A Unified Metric for Video Generation Quality

Akshat Rakheja, Aarsh Ashdhir, Aryan Bhattacharjee, Vanshika Sharma

机构 * Equal contribution(共同贡献)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments 27 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18552 2025-07-25 cs.CV cs.AI 79%

VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding

Baoyao Yang, Wanyun Li, Dixin Chen, Junxiang Chen, Wenbin Yao, Haifeng Lin

机构 * Guangdong University of Technology(广东工业大学) Wechat, Tencent(微信、腾讯)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments 7 pages; 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16718 2025-07-23 cs.CV 79%

Temporally-Constrained Video Reasoning Segmentation and Automated Benchmark Construction

Yiqing Shen, Chenjia Li, Chenxiao Fan, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15028 2025-07-22 cs.CV 79%

Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding

Yuanhan Zhang, Yunice Chew, Yuhao Dong, Aria Leo, Bo Hu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视频数据与评测 :video reasoning(title);video understanding(abstract);分类 cs.CV

Comments ICCV 2025; Project page: https://zhangyuanhan-ai.github.io/video-tt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15681 2025-07-18 cs.CV 79%

Vidi: Large Multimodal Models for Video Understanding and Editing

Vidi Team, Celong Liu, Chia-Wen Kuo, Dawei Du, Fan Chen, Guang Chen, Jiamin Yuan, Lingxi Zhang, Lu Guo, Lusha Li, Longyin Wen, Qingyu Chen, Rachel Deng, Sijie Zhu, Stuart Siew, Tong Jin, Wei Lu, Wen Zhong, Xiaohui Shen, Xin Gu, Xing Mei, Xueqiong Qu, Zhenfang Chen

机构 * Intelligent Editing Team(智能编辑团队) Intelligent Creation, ByteDance Inc.(智能创作,字节跳动公司)

专题命中 视频数据与评测 :video understanding(title);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05040 2025-07-01 cs.CV 79%

InstructionBench: An Instructional Video Understanding Benchmark

Haiwan Wei, Yitian Yuan, Xiaohan Lan, Wei Ke, Lin Ma

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21374 2025-05-28 cs.CV 79%

Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?

Junhao Cheng, Yuying Ge, Teng Wang, Yixiao Ge, Jing Liao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG广告实验室) City University of Hong Kong(香港城市大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

Comments Homepage: https://github.com/TencentARC/Video-Holmes

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24008 2025-05-28 cs.CV cs.AI 79%

H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding

Qi Wu, Quanlong Zheng, Yanhao Zhang, Junlin Xie, Jinguo Luo, Kuo Wang, Peng Liu, Qingsong Xie, Ru Zhen, Zhenyu Yang, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12589 2025-05-20 cs.CV 79%

SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models

Bo Liu, Pengfei Qiao, Minhan Ma, Xuange Zhang, Yinan Tang, Peng Xu, Kun Liu, Tongtong Yuan

机构 * Department of Computer Science, Beijing University of Technology(北京理工大学计算机科学系) Inspur Electronic Information Industry Co., Ltd(Inspur电子信息产业有限公司) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) JD Explore Academy(京东探索研究院)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

Comments The dataset and code are publicly available at: https://huggingface.co/datasets/fei213/SurveillanceVQA-589K

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04907 2025-04-30 cs.CV cs.AI 79%

Video-Bench: Human-Aligned Video Generation Benchmark

Hui Han, Siyuan Li, Jiaqi Chen, Yiwen Yuan, Yuling Wu, Chak Tou Leong, Hanwen Du, Junchen Fu, Youhua Li, Jie Zhang, Chi Zhang, Li-jia Li, Yongxin Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) Fellou AI(Fellou人工智能) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学) University of Glasgow(格拉斯哥大学) City University of Hong Kong(香港城市大学) Westlake University(西湖大学) LiveX AI(LiveX人工智能) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments Accepted by CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23452 2025-04-29 cs.CV 79%

VideoGen-Eval: Agent-based System for Video Generation Evaluation

Yuhang Yang, Ke Fan, Shangkun Sun, Hongxiang Li, Ailing Zeng, FeiLin Han, Wei Zhai, Wei Liu, Yang Cao, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) SJTU(上海交通大学) PKUSZ(北京大学软件学院) Tencent(腾讯) BFA(北京航空航天大学)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments project:https://github.com/AILab-CVC/VideoGen-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07184 2025-04-22 cs.CV 79%

TVPR: Text-to-Video Person Retrieval and a New Benchmark

Xu Zhang, Fan Ni, Guan-Nan Dong, Aichun Zhu, Jianhui Wu, Mingcheng Ni, Hui Liu

机构 * Nanjing Tech University(南京理工大学)

专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV

Comments 9 pages, 8 figures, Proceedings of the 32nd ACM International Conference on Multimedia

Journal ref The 32nd ACM International Conference on Multimedia. 2024: 10105-10113

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09754 2025-04-04 cs.CV 79%

ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation

Ali Athar, Xueqing Deng, Liang-Chieh Chen

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Project page: https://ali2500.github.io/vicas-project/

详情

展开后加载摘要…

URL PDF HTML 收藏