arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2601.18100 2026-04-09 cs.CV 70%

Spatial-Conditioned Reasoning in Long-Egocentric Videos

长时自体视频中的空间条件推理

James Tribble, Hao Wang, Si-En Hong, Chaoyi Zhou, Ashish Bastola, Siyu Huang, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05117 2026-04-08 cs.CV cs.AI cs.CL 70%

Watch Before You Answer: Learning from Visually Grounded Post-Training

在回答前观看:从视觉引导的后训练中学习

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu Jiang, Xuan He, Shenhui Zhang, Ping Nie, Peter West, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Etude AI Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文发现现有视频理解基准中40-60%的问题可通过文本线索回答,提出VidGround方法通过仅使用视觉引导问题提升VLM性能,实验显示其在后训练中效果优于复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 70%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21835 2026-03-09 cs.CV 70%

UniVBench: Towards Unified Evaluation for Video Foundation Models

UniVBench:迈向统一评估视频基础模型

Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) Zhejiang Lab(浙江实验室)

专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 UniVBench通过统一评估系统和多任务视频任务,首次提供衡量视频基础模型综合能力的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00288 2026-02-26 cs.CV cs.AI 70%

TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

TimeBlind: 一种用于视频大语言模型的时空组合性基准

Baiqi Li, Kangyi Zhao, Ce Zhang, Chancharik Mitra, Jean de Dieu Nyandwi, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 TimeBlind通过细粒度时空理解基准揭示视频大语言模型对时间动态理解的不足,展示其在实例准确率上的显著劣势,强调对静态视觉捷径的依赖。

Comments For code and data, see https://baiqi-li.github.io/timeblind_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08545 2026-01-27 cs.CV 70%

T2VEval: Benchmark Dataset and Objective Evaluation Method for T2V-generated Videos

T2VEval: 用于T2V生成视频的基准数据集和客观评估方法

Zelu Qi, Ping Shi, Shuqi Wang, Chaoyang Zhang, Fei Zhao, Zefeng Ying, Da Pan, Xi Yang, Zheqi He, Teng Dai

机构 * School of Information and Communication Engineering, Communication University of China, No.1 East Street, Dingfuzhuang, Chaoyang District, Beijing, China(信息与通信工程学院,中国传媒大学) Beijing Academy of Artificial Intelligence, No.150 Chengfu Road, Haidian District, Beijing, China(北京人工智能研究院)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 T2VEval提出了一种多分支融合方案,通过多维评估指标对T2V生成视频进行客观质量评估,提升视频生成模型的优化效果。

Comments This paper has been accepted by DISPLAYS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12558 2026-01-13 cs.CV cs.AI 70%

MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval

MomentSeeker: 一个面向任务的长视频时刻检索基准

Huaying Yuan, Jian Ni, Zheng Liu, Yueze Wang, Junjie Zhou, Zhengyang Liang, Bo Zhao, Zhao Cao, Zhicheng Dou, Ji-Rong Wen

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 MomentSeeker提出一个面向任务的长视频时刻检索基准,通过多样化的视频和查询形式,评估长视频中关键时刻检索的准确性和效率挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06376 2025-12-09 cs.CV 70%

Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework

AI生成的驾驶视频是否准备好用于自动驾驶?一种诊断评估框架

Xinhao Xiang, Abhijeet Rastogi, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种诊断评估框架,系统研究AI生成驾驶视频在自动驾驶训练和评估中的可靠性,通过分析失败模式和构建基准测试,验证了过滤AIGVs可提升性能并补充现实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01989 2025-12-02 cs.CV 70%

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18382 2025-11-25 cs.CV 70%

ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access

ViMix-14M:一个经过精心整理的多源视频-文本数据集,具有长形式、高质量的描述和无爬虫访问

Timing Yang, Sucheng Ren, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 ViMix-14M是一个经过精心整理的多源视频-文本数据集,提供无爬虫访问、高质量描述和长形式文本,用于提升视频生成和多模态任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06281 2025-11-11 cs.CV 70%

VideoSSR: Video Self-Supervised Reinforcement Learning

Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, Yu Cheng

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学)

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19875 2025-11-11 cs.CV 70%

InfiniBench: A Benchmark for Large Multi-Modal Models in Long-Form Movies and TV Shows

Kirolos Ataallah, Eslam Abdelrahman, Mahmoud Ahmed, Chenhui Gou, Khushbu Pahwa, Jian Ding, Mohamed Elhoseiny

机构 * KAUST(卡塔尔科技大学) Monash University(墨尔本大学) RICE University(里士满大学)

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted for oral presentation at the EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19568 2025-10-07 cs.CV cs.AI 70%

How Far are AI-generated Videos from Simulating the 3D Visual World: A Learned 3D Evaluation Approach

Chirui Chang, Jiahui Liu, Zhengzhe Liu, Xiaoyang Lyu, Yi-Hua Huang, Xin Tao, Pengfei Wan, Di Zhang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Lingnan University(岭大)

专题命中 视频数据与评测 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02571 2025-10-06 cs.CV cs.AI cs.CL 70%

How Confident are Video Models? Empowering Video Models to Express their Uncertainty

Zhiting Mei, Ola Shorinwa, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22799 2025-09-30 cs.CV cs.AI cs.CL 70%

VideoScore2: Think before You Score in Generative Video Evaluation

Xuan He, Dongfu Jiang, Ping Nie, Minghao Liu, Zhengxuan Jiang, Mingyi Su, Wentao Ma, Junru Lin, Chun Ye, Yi Lu, Keming Wu, Benjamin Schneider, Quy Duc Do, Zhuofeng Li, Yiming Jia, Yuxuan Zhang, Guo Cheng, Haozhe Wang, Wangchunshu Zhou, Qunshu Lin, Yuanxing Zhang, Ge Zhang, Wenhao Huang, Wenhu Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Independent(独立) M-A-P University of Toronto(多伦多大学) Zhejiang University(浙江大学) Abaka AI

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10922 2025-08-18 cs.CV 70%

A Survey on Video Temporal Grounding with Multimodal Large Language Model

Jianlong Wu, Wei Liu, Ye Liu, Meng Liu, Liqiang Nie, Zhouchen Lin, Chang Wen Chen

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments 20 pages,6 figures,survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16619 2025-07-24 cs.CV 70%

Human-Activity AGV Quality Assessment: A Benchmark Dataset and an Objective Evaluation Metric

Zhichao Zhang, Wei Sun, Xinyue Li, Yunhao Li, Qihang Ge, Jun Jia, Zicheng Zhang, Zhongpeng Ji, Fengyu Sun, Shangling Jui, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05328 2025-07-23 cs.CV 70%

AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs

Lidong Lu, Guo Chen, Zhiqi Li, Yicheng Liu, Tong Lu

机构 * Nanjing University(南京大学)

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13609 2025-07-21 cs.CV cs.CL 70%

CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks

Yanan Wang, Julio Vizcarra, Zhi Li, Hao Niu, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究公司)

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13691 2025-06-17 cs.CV 70%

UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions

Zhucun Xue, Jiangning Zhang, Teng Hu, Haoyang He, Yinan Chen, Yuxuan Cai, Yabiao Wang, Chengjie Wang, Yong Liu, Xiangtai Li, Dacheng Tao

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23484 2025-05-30 cs.CV 70%

VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation

Shi-Xue Zhang, Hongfa Wang, Duojun Huang, Xin Li, Xiaobin Zhu, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Tencent(腾讯) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments submitting

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15182 2025-04-22 cs.CV 70%

Tiger200K: Manually Curated High Visual Quality Video Dataset from UGC Platform

Xianpan Zhou

机构 * Xianpan Zhou

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://tinytigerpan.github.io/tiger200k/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10326 2025-03-26 cs.CV 70%

VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs

Rohit Bharadwaj, Hanan Gani, Muzammal Naseer, Fahad Shahbaz Khan, Salman Khan

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01180 2025-03-24 cs.CV cs.CL 70%

UAL-Bench: The First Comprehensive Unusual Activity Localization Benchmark

Hasnat Md Abdullah, Tian Liu, Kangda Wei, Shu Kong, Ruihong Huang

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV

Journal ref wacv(2025) 5801-5811

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09367 2025-03-10 cs.CV 70%

Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs

Zijia Zhao, Haoyu Lu, Yuqi Huo, Yifan Du, Tongtian Yue, Longteng Guo, Bingning Wang, Weipeng Chen, Jing Liu

专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20063 2025-03-04 cs.CV 70%

Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs

Zicheng Zhang, Ziheng Jia, Haoning Wu, Chunyi Li, Zijian Chen, Yingjie Zhou, Wei Sun, Xiaohong Liu, Xiongkuo Min, Weisi Lin, Guangtao Zhai

专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11775 2025-02-18 cs.CV 70%

video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model

Guangzhi Sun, Yudong Yang, Jimin Zhuang, Changli Tang, Yixuan Li, Wei Li, Zejun MA, Chao Zhang

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08234 2025-02-13 cs.CV 70%

Learning Human Skill Generators at Key-Step Levels

Yilu Wu, Chenhui Zhu, Shuai Wang, Hanlin Wang, Jing Wang, Zhaoxiang Zhang, Limin Wang

专题命中 视频数据与评测 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06908 2025-02-07 cs.CV cs.CL 70%

EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation

Hao Liang, Zirong Chen, Hejun Dong, Wentao Zhang

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01549 2025-02-04 cs.IR cs.AI cs.CV 70%

VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos

Xubin Ren, Lingrui Xu, Long Xia, Shuaiqiang Wang, Dawei Yin, Chao Huang

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏