arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2603.14426 2026-03-17 cs.CV cs.IR cs.MM 81%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23969 2026-03-02 cs.MM cs.CV 81%

MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation

MSVBench: 向多镜头视频生成的人机水平评估迈进

Haoyuan Shi, Yunxin Li, Nanhao Deng, Zhenran Xu, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 MSVBench通过引入分层脚本和参考图像,提出混合评估框架,验证了视频生成模型的连贯性和吸引力,并展示了其在多镜头视频生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20159 2026-02-25 cs.CV cs.AI cs.LG cs.MM cs.RO 81%

A Very Big Video Reasoning Suite

一个非常大的视频推理套件

Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, Hokin Deng

机构 * University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) University of Tübingen(图宾根大学) Johns Hopkins University(约翰霍普金斯大学) University of Michigan(密歇根大学) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of Texas at Austin(得克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) San Jose State University(圣何塞州立大学) University of California, Irvine(加州大学尔湾分校) Technical University of Munich(慕尼黑技术大学) University of California, San Diego(加州大学圣地亚哥分校) Imperial College London(伦敦帝国学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) University of Edinburgh(爱丁堡大学) Hong Kong University of Science(香港科学大学) New York University(纽约大学) Auburn University(阿伯丁大学) Columbia University(哥伦比亚大学) University of Bristol(布里斯托大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV、cs.MM

AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。

Comments Homepage: https://video-reason.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17305 2025-10-22 cs.CV cs.MM 81%

LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding

ZhaoYang Han, Qihan Lin, Hao Liang, Bowen Chen, Zhou Liu, Wentao Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学)

专题命中 视频数据与评测 :video understanding(title);long video(abstract);分类 cs.CV、cs.MM

Comments Submitted to ARR Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14515 2024-10-31 cs.CV cs.MM 81%

MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding

Xinyu Fang, Kangrui Mao, Haodong Duan, Xiangyu Zhao, Yining Li, Dahua Lin, Kai Chen

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV、cs.MM

Comments Accepted in NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08813 2024-10-22 cs.CV cs.LG cs.MM 81%

CinePile: A Long Video Question Answering Dataset and Benchmark

Ruchit Rawal, Khalid Saifullah, Miquel Farré, Ronen Basri, David Jacobs, Gowthami Somepalli, Tom Goldstein

专题命中 视频数据与评测 :long video(title);video understanding(abstract);分类 cs.CV、cs.MM

Comments Project page with all the artifacts - https://ruchitrawal.github.io/cinepile/. Updated version with adversarial refinement pipeline and more model evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.06827 2021-10-14 cs.MM cs.CV cs.LG 81%

NoisyActions2M: A Multimedia Dataset for Video Understanding from Noisy Labels

Mohit Sharma, Raj Patra, Harshal Desai, Shruti Vyas, Yogesh Rawat, Rajiv Ratn Shah

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV、cs.MM

Comments Accepted at ACM Multimedia Asia 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.03201 2020-05-08 cs.CV eess.IV 81%

What comprises a good talking-head video generation?: A Survey and Benchmark

Lele Chen, Guofeng Cui, Ziyi Kou, Haitian Zheng, Chenliang Xu

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.03296 2017-07-12 cs.CV 80%

Hierarchical Deep Recurrent Architecture for Video Understanding

Luming Tang, Boyang Deng, Haiyu Zhao, Shuai Yi

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments Accepted as Classification Challenge Track paper in CVPR 2017 Workshop on YouTube-8M Large-Scale Video Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07417 2026-08-10 cs.CV cs.AI 新提交 79%

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

我在视频中寻找你:面向以人为中心的视频推理的身份条件查询

Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang

机构 * Beijing Jiaotong University(北京交通大学) HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。

Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 79%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01095 2026-06-16 cs.CV cs.AI cs.LG 版本更新 79%

CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions

CycliST:用于循环状态转换推理的视频语言模型基准

Simon Kohaut, Daniel Ochs, Shun Zhang, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami

机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(人工智能与机器学习实验室,图腾斯达特技术大学) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(Konrad Zuse 学校(ELIZA)) Honda Research Institute Europe GmbH, Offenbach, Germany(本田欧洲研究院,奥芬巴赫,德国) Uncertainty in Artificial Intelligence Group, TU Eindhoven(人工智能不确定性小组,埃因霍温技术大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心(hessian.AI)) Center for Cognitive Science(认知科学中心) German Center for Artificial Intelligence (DFKI)(德国人工智能中心(DFKI))

专题命中 视频数据与评测 :video language model(title,abstract);分类 cs.CV

AI总结 提出CycliST基准,通过合成视频评估视频语言模型对循环状态转换的文本推理能力,揭示现有模型在检测循环模式、时间理解和定量分析方面的局限。

Comments Published in the Journal of Data-centric Machine Learning Research (DMLR); https://openreview.net/forum?id=l03g53HUL2

Journal ref Journal of Data-centric Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12300 2026-06-11 cs.CV cs.AI 新提交 79%

Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition

自然语言在小时级视频中的时间定位是一个搜索问题:基准与经验分解

Sukmin Seo, Geewook Kim

机构 * NAVER Cloud AI KAIST AI(韩国科学技术院人工智能系)

专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV

AI总结 针对小时级视频的自然语言时间定位,提出搜索是主要瓶颈而非识别,发布首个开放小时级定位基准ExtremeWhenBench,并通过检索-定位混合方法显著提升性能。

Comments 10 pages, 6 figures, Code and benchmark: https://github.com/naver-ai/ExtremeWhenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29643 2026-05-29 cs.CV cs.MA 79%

AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning

AgentCVR:通过脚本模拟强化学习的主动多智能体跨视频推理

Yilun Qiu, Jiahe Wang, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Chun Yuan

机构 * Xiaohongshu Inc.(小红书公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 提出AgentCVR多智能体框架,将跨视频推理视为主动证据获取任务,通过主智能体协调视觉和音频智能体进行定向证据提取,并引入脚本模拟强化学习优化策略,在跨视频对齐和定位任务上超越单次基线,达到与闭源系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05015 2026-04-08 cs.CV 79%

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

Video-MME-v2:迈向综合视频理解基准的下一阶段

Chaoyou Fu, Haozhi Yuan, Yuhao Dong, Yi-Fan Zhang, Yunhang Shen, Xiaoxing Hu, Xueying Li, Jinsen Su, Chengwu Long, Xiaoyao Xie, Yongkang Xie, Xiawu Zheng, Xue Yang, Haoyu Cao, Yunsheng Wu, Ziwei Liu, Xing Sun, Caifeng Shan, Ran He

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

AI总结 Video-MME-v2通过三级层次结构和非线性评估策略,评估视频理解的鲁棒性和准确性,揭示当前模型与人类专家间的差距及多模态推理瓶颈。

Comments Homepage: https://video-mme-v2.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09299 2026-04-07 cs.CV cs.SD 79%

VABench: A Comprehensive Benchmark for Audio-Video Generation

VABench:音频视频生成的综合性基准

Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence (Peking University)(北京市数据智能重点实验室(北京大学)) Ant Group(蚂蚁集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出VABench,一个用于评估同步音频视频生成能力的综合性基准,涵盖三种任务类型和15个评估维度,旨在建立新的评估标准以推动视频生成领域的发展。

Comments 24 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05513 2026-04-01 cs.CV 79%

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

AI总结 Know-Show基准测试评估视频语言模型在时空 grounded 推理能力,通过五个互补场景揭示现有模型与人类推理的差距,并提出GRAM方法提升模型的细粒度 grounded 推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 79%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14468 2026-03-17 cs.CV cs.IR 79%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 视频数据与评测 :long video(title,abstract);分类 cs.CV

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19420 2026-03-17 cs.CV cs.LG 79%

CircuitProbe: Tracing Visual Temporal Evidence Flow in Video Language Models

CircuitProbe: 跟踪视频语言模型中的视觉时间证据流

Yiming Zhang, Zhuokai Zhao, Chengzhang Yu, Kun Wang, Zhendong Chu, Qiankun Li, Zihan Chen, Yang Liu, Zenghui Ding, Yining Sun, Qingsong Wen

专题命中 视频数据与评测 :video language model(title);video-language(abstract);分类 cs.CV

AI总结 研究提出CircuitProbe框架,通过视觉审计和语义追踪分析视频语言模型中的时间证据流,设计针对性干预提升时间理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23823 2026-03-04 cs.CV 79%

APPO: Attention-guided Perception Policy Optimization for Video Reasoning

APPO:基于注意力的视频推理感知策略优化

Henghui Du, Chang Zhou, Xi Chen, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学北京校区人工智能学院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG人工智能技术中心)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 APPO通过基于注意力的感知策略优化,利用token级奖励提升视频推理中的细粒度感知能力,有效提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11244 2026-02-13 cs.CV 79%

Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models

压力测试揭示视频-语言模型中脆弱的时间与视觉基础

Sethuraman T, Savya Khosla, Aditi Tiwari, Vidya Ganesh, Rakshana Jayaprakash, Aditya Jain, Vignesh Srinivasakumar, Onkar Kishor Susladkar, Srinidhi Sunkara, Aditya Shanmugham, Rakesh Vaideeswaran, Abbaas Alif Mohamed Nishar, Simon Jenni, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Qualtrics iManage NVIDIA Amazon Science(亚马逊科学) Capital One

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

AI总结 REVEAL{}通过五个压力测试揭示视频-语言模型在时间与视觉基础方面的脆弱性,展示其在处理视频内容、时间序列和运动方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20297 2026-01-29 cs.CV 79%

Artifact-Aware Evaluation for High-Quality Video Generation

面向高质量视频生成的缺陷感知评估

Chen Zhu, Jiashu Zhu, Yanxun Li, Meiqi Wu, Bingze Song, Chubin Chen, Jiahong Wu, Xiangxiang Chu, Yangang Wang

机构 * Southeast University(东南大学) AMAP, Alibaba Group(阿里云AMAP) CASIA

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出DVAR框架,通过GenVID数据集实现对视频生成缺陷的细粒度检测与分类,提升缺陷识别准确率并有效过滤低质量内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15016 2026-01-22 cs.CV 79%

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

LiViBench:面向交互式直播视频理解的多模态基准测试

Xiaodong Wang, Langling Huang, Zhirong Wu, Xu Zhao, Teng Xu, Xuhong Xia, Peixi Peng

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。

Comments AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17722 2026-01-09 cs.CV cs.AI 79%

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu

机构 * Fudan University(复旦大学) NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。

Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13238 2025-12-16 cs.CV 79%

Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance

Ego-EXTRA:视频语言眼动数据集用于专家-学员协助

Francesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob Engel, Antonino Furnari, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science - University of Catania(数学与计算机科学系 - 卡塔尼亚大学) Next Vision s.r.l. - Spinoff of the University of Catania(Next Vision公司 - 卡塔尼亚大学衍生机构) Meta Reality Labs Research(Meta现实实验室)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

AI总结 Ego-EXTRA数据集通过专家-学员双向对话评估多模态大语言模型,揭示其在专家级帮助中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06277 2025-12-12 cs.CV 79%

ExAct: A Video-Language Benchmark for Expert Action Analysis

ExAct:一种视频-语言基准,用于专家动作分析

Han Yi, Yulu Pan, Feihong He, Xinyu Liu, Benjamin Zhang, Oluwatumininu Oguntola, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

AI总结 ExAct是一个用于专家级物理活动理解的视频-语言基准,通过专家整理的视频问题-答案对评估VLMs的精准理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01424 2025-12-05 cs.CV 79%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16668 2025-11-21 cs.CV 79%

V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models

V-ReasonBench:面向视频生成模型的统一推理基准套件

Yang Luo, Xuanlei Zhao, Baijiong Lin, Lingting Zhu, Liyao Tang, Yuqi Liu, Ying-Cong Chen, Shengju Qian, Xin Wang, Yang You

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USYD(澳大利亚悉尼大学) CUHK(香港中文大学) LIGHTSPEED Project(LIGHTSPEED项目)

专题命中 视频数据与评测 :video generation(title);video reasoning(abstract);分类 cs.CV

AI总结 V-ReasonBench通过四个维度评估视频生成模型的推理能力,提供可验证任务以衡量结构化问题解决、空间认知、模式推理和物理动态,促进更可靠的推理模型发展。

Comments Project Page: https://oahzxl.github.io/VReasonBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02373 2025-11-19 cs.CV 79%

UVLM: Benchmarking Video Language Model for Underwater World Understanding

Xizhe Xue, Yang Zhou, Dawei Yan, Lijie Tao, Junjie Li, Ying Li, Haokui Zhang, Rong Xiao

专题命中 视频数据与评测 :video language model(title,abstract);分类 cs.CV

Comments 18 pages, 10 figures, 7 tables. Accepted to the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏