arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 578 篇

2410.00741 2024-10-07 cs.CL cs.CV cs.MM 62%

VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models

Jiapeng Wang, Chengyu Wang, Kunzhe Huang, Jun Huang, Lianwen Jin

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments EMNLP 2024 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01669 2024-08-20 cs.CV cs.MM 62%

SynopGround: A Large-Scale Dataset for Multi-Paragraph Video Grounding from TV Dramas and Synopses

Chaolei Tan, Zihang Lin, Junfu Pu, Zhongang Qi, Wei-Yi Pei, Zhi Qu, Yexin Wang, Ying Shan, Wei-Shi Zheng, Jian-Fang Hu

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM MM 2024. Project page: https://synopground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02272 2024-08-06 cs.CV cs.CL cs.MM 62%

COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark

Koki Maeda, Tosho Hirasawa, Atsushi Hashimoto, Jun Harashima, Leszek Rybicki, Yusuke Fukasawa, Yoshitaka Ushiku

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments ECCV2024 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15046 2024-07-23 cs.CV cs.CL cs.MM 62%

Audio-visual training for improved grounding in video-text LLMs

Shivprasad Sagare, Hemachandran S, Kinshuk Sarabhai, Prashant Ullegaddi, Rajeshkumar SA

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04928 2024-07-09 cs.CV eess.IV 62%

CLIPVQA:Video Quality Assessment via CLIP

Fengchuang Xing, Mingjie Li, Yuan-Gen Wang, Guopu Zhu, Xiaochun Cao

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01291 2024-06-19 cs.CV cs.AI cs.CL cs.LG cs.MM 62%

Evaluating Text-to-Visual Generation with Image-to-Text Generation

Zhiqiu Lin, Deepak Pathak, Baiqi Li, Jiayao Li, Xide Xia, Graham Neubig, Pengchuan Zhang, Deva Ramanan

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、cs.MM

Comments We open-source our data, model, and code at: https://github.com/linzhiqiu/t2v_metrics ; Project page: https://linzhiqiu.github.io/papers/vqascore

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14899 2024-03-25 cs.CV cs.AI cs.CL cs.MM 62%

FunQA: Towards Surprising Video Comprehension

Binzhu Xie, Sicheng Zhang, Zitang Zhou, Bo Li, Yuanhan Zhang, Jack Hessel, Jingkang Yang, Ziwei Liu

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV、cs.MM

Comments Project Page: https://funqa-benchmark.github.io/ Codebase: https://github.com/Jingkang50/FunQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06176 2023-09-13 cs.CV cs.MM 62%

Dual-Path Temporal Map Optimization for Make-up Temporal Video Grounding

Jiaxiu Li, Kun Li, Jia Li, Guoliang Chen, Dan Guo, Meng Wang

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14657 2023-05-01 cs.CV cs.MM 62%

Knowledge Enhanced Model for Live Video Comment Generation

Jieting Chen, Junkai Ding, Wenping Chen, Qin Jin

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13887 2022-11-28 cs.AI cs.CL cs.CV cs.GR eess.IV 62%

TPA-Net: Generate A Dataset for Text to Physics-based Animation

Yuxing Qiu, Feng Gao, Minchen Li, Govind Thattai, Yin Yang, Chenfanfu Jiang

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08190 2022-08-18 cs.CV cs.LG eess.IV 62%

DeepSportradar-v1: Computer Vision Dataset for Sports Understanding with High Quality Annotations

Gabriel Van Zandycke, Vladimir Somers, Maxime Istasse, Carlo Del Don, Davide Zambrano

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.14631 2022-01-25 cs.CV eess.IV 62%

Text2Video: Text-driven Talking-head Video Synthesis with Personalized Phoneme-Pose Dictionary

Sibo Zhang, Jiahong Yuan, Miao Liao, Liangjun Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV、eess.IV

Comments ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.04884 2021-06-22 cs.CV cs.LG cs.MM cs.SD eess.AS 62%

Piano Skills Assessment

Paritosh Parmar, Jaiden Reddy, Brendan Morris

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments Dataset is available from: https://github.com/ParitoshParmar/Piano-Skills-Assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.09889 2021-06-21 cs.CL cs.CV cs.MM 62%

GEM: A General Evaluation Benchmark for Multimodal Tasks

Lin Su, Nan Duan, Edward Cui, Lei Ji, Chenfei Wu, Huaishao Luo, Yongfei Liu, Ming Zhong, Taroon Bharti, Arun Sacheti

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

Comments Accepted by Findings of ACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.09411 2021-04-20 cs.CV cs.MM 62%

Understanding Chinese Video and Language via Contrastive Multimodal Pre-Training

Chenyi Lei, Shixian Luo, Yong Liu, Wanggui He, Jiamang Wang, Guoxin Wang, Haihong Tang, Chunyan Miao, Houqiang Li

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.10514 2021-01-27 cs.CV cs.MM 62%

How Good is a Video Summary? A New Benchmarking Dataset and Evaluation Framework Towards Realistic Video Summarization

Vishal Kaushal, Suraj Kothawade, Anshul Tomar, Rishabh Iyer, Ganesh Ramakrishnan

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments 19 pages, 6 tables, 4 figures. arXiv admin note: substantial text overlap with arXiv:2007.14560

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13202 2020-11-30 cs.CV cs.GR cs.LG eess.IV 62%

t-EVA: Time-Efficient t-SNE Video Annotation

Soroosh Poorgholi, Osman Semih Kayhan, Jan C. van Gemert

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、eess.IV

Comments ICPR 2020 (HCAU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.14560 2020-08-26 cs.CV cs.IR cs.LG cs.MM 62%

Realistic Video Summarization through VISIOCITY: A New Benchmark and Evaluation Framework

Vishal Kaushal, Suraj Kothawade, Rishabh Iyer, Ganesh Ramakrishnan

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments 19 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.09418 2020-05-15 cs.MM cs.CV 62%

Video Storytelling: Textual Summaries for Events

Junnan Li, Yongkang Wong, Qi Zhao, Mohan S. Kankanhalli

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV、cs.MM

Comments Published in IEEE Transactions on Multimedia

Journal ref J. Li, Y. Wong, Q. Zhao and M. S. Kankanhalli, "Video Storytelling: Textual Summaries for Events," in IEEE Transactions on Multimedia, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.00623 2019-04-02 cs.AI cs.CV cs.LG cs.MM 62%

Constructing Hierarchical Q&A Datasets for Video Story Understanding

Yu-Jung Heo, Kyoung-Woon On, Seongho Choi, Jaeseo Lim, Jinah Kim, Jeh-Kwang Ryu, Byung-Chull Bae, Byoung-Tak Zhang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted to AAAI 2019 Spring Symposium Series : Story-Enabled Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.07607 2017-09-28 cs.MM cs.CL cs.CV 62%

Fine-Grain Annotation of Cricket Videos

Rahul Anand Sharma, Pramod Sankar K, CV Jawahar

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

Comments ACPR 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01391 2026-06-12 cs.CV 版本更新 61%

VISTA: Video Interaction Spatio-Temporal Analysis Benchmark

VISTA:视频交互时空分析基准

Alejandro Aparcedo, Akash Kumar, Aaryan Garg, Dalton Pham, Wen-Kai Chen, Anirudh Bharadwaj, Aman Chadha, Yogesh Rawat

机构 * University of Central Florida(中央佛罗里达大学) BITS Pilani(比特斯理工学院) Ho Chi Minh City University of Science(胡志明市科学大学) Amazon GenAI Project(亚马逊生成人工智能项目)

专题命中 视频数据与评测 :video understanding(abstract,comments);分类 cs.CV

AI总结 提出VISTA基准,通过分解视频为实体、动作和关系,实现开放集多实体多动作的时空理解评估,揭示传统指标掩盖的偏差。

Comments Accepted to CVPR 2026 Workshop on Pixel-level Video Understanding in the Wild (PVUW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21360 2026-08-24 cs.CV 新提交 57%

OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

OmniAssistBench:面向全模态大语言模型(Omni-LLMs)的助手式交互基准

Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan

机构 * Nankai University(南开大学) University of Waterloo(滑铁卢大学) Nanjing University(南京大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 针对全模态大语言模型助手式交互的评估瓶颈,构建OmniAssistBench数据集,实验显示Gemini-3-Pro、Qwen3-Omni-Instruct表现存在差距,当前模型在多轮交互等方面仍有不足。

Comments Project page: this https URL (https://xianyunsun.github.io/OmniAssistBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18607 2026-08-21 cs.CV 版本更新 57%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: https://github.com/ShareLab-SII/VA-Judger

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21282 2026-08-19 cs.CV 版本更新 57%

WorldBench: Benchmarking Physical Understanding of World Models by Isolating Physics Concepts

WorldBench: 为世界模型诊断评估进行物理辨析

Rishi Upadhyay, Howard Zhang, Jim Solomon, Ayush Agrawal, Yunhao Ba, Alex Wong, Celso M de Melo, Achuta Kadambi

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sony AI(索尼人工智能) Yale University(耶鲁大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 WorldBench通过概念特定的解耦评估,提升世界模型的物理推理能力评估的准确性和可扩展性。

Comments Webpage: https://world-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09200 2026-08-14 cs.CV 版本更新 57%

NBA_Streaming: A Large-Scale Benchmark for Fine-Grained Basketball Commentary Generation in Continuous Streams

NBA_Streaming:用于连续流中细粒度篮球评论生成的大规模基准测试

Lifang Wu, Yuyang Wu, Yangdong Gao, Fengyu Liu, Ya Jing, Liang Wang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) Fudan University(复旦大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 针对现有篮球评论生成方法与数据集不适用于连续流的局限,推出大规模基准NBA_Streaming,提出因果两阶段框架,可有效提升在线细粒度篮球评论生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10317 2026-08-12 cs.CV 新提交 57%

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning

从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench

Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

机构 * NVIDIA(英伟达) Santa Clara University(圣克拉拉大学)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09594 2026-08-11 cs.CV cs.AI 新提交 57%

Illusion or Integrity? Geometrical Consistency Metric for AIGC Video Quality Evaluation

幻觉还是完整性?用于AIGC视频质量评估的几何一致性指标

Yifei Xue, Yuanchen Fei, Hao Zhang, Chenzhi Nie, Tie ji, Yizhen Lao

机构 * Hunan University(湖南大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 针对现有AIGC视频质量评估缺乏物理定律保真度量化指标的问题,提出GeoCon-Bench基准,通过帧间几何一致性评估AIGC视频质量,经实验验证其可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09139 2026-08-11 cs.CV 新提交 57%

CodecArena: Codec Quality Assessment via Visual Reinforcement Learning

CodecArena:基于视觉强化学习的编解码器质量评估

Jiaye Fu, Weiqi Li, Qiankun Gao, Yanchen Zhao, Xiandong Meng, Jian Zhang, Siwei Ma, Jiaqi Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 研究针对视频编码主流指标无法准确评估内容保真度的问题,提出首个视频编码质量评估视觉-语言框架CodecArena,采用视觉强化学习方案优化,构建相关数据集与基准,在源不相交内容上实现优于现有方法的人类判断一致性。

Comments The project page is: https://jyfu-vcl.github.io/codecarena

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05747 2026-08-07 cs.CV 新提交 57%

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?

Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li

机构 * ByteDance Seed(字节跳动 Seed) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏